🗂️
개발 중
AI Memory System
LLM 장기기억 저장소
MongoDB + Elasticsearch + KoT5 로 대화/문서를 요약·색인해 LLM 에게 장기기억을 제공하는 메모리 백엔드.
배경
AI 챗봇을 학습시키려면 여러 형식·출처의 방대한 텍스트를 일일이 정리·라벨링해야 합니다. 이 과정을 자동화해 학습 데이터 준비 부담을 줄입니다.
핵심 기능
- AIHub 등 데이터셋(JSONL) 자동 적재
- MongoDB 원문 저장 + Elasticsearch 색인으로 키워드·의미 검색 병행
- 임베딩 기반 유사도 검색·군집화
- KoT5·KoAlpaca 등 한국어 모델 파인튜닝 파이프라인
- 비정형 문서 → JSONL 학습 포맷 자동 생성
- 학습한 모델을 FastAPI 채팅 서버로 노출
동작 방식
원천 데이터를 MongoDB에 적재하고 Elasticsearch로 색인한 뒤, 검색 모듈이 키워드/임베딩 방식으로 관련 문맥을 모아 JSONL 학습셋을 만듭니다. 이 데이터로 모델을 파인튜닝하고 추론 API로 서빙합니다.
사용 방법
- 원천 JSONL 데이터를 raw_data 폴더에 넣는다
- MongoDB 적재 → Elasticsearch 색인 스크립트를 실행한다
- 학습용 JSONL 생성 후 모델 학습을 돌린다
- uvicorn으로 채팅 API를 띄운다
분류: 그 외 · 원본 경로: D:\python_Project\ai_memory_system