Project brief
프로젝트 내용
[프로젝트 개요]
- 운영 준비 중인 웹 서비스에 공식 자료 기반 RAG AI 챗봇이 이미 구현되어 있습니다. 이번 프로젝트는 챗봇을 처음부터 새로 개발하는 것이 아니라, 기존 RAG 시스템을 진단하고 사용자의 질문에 맞는 공식 자료가 정확히 검색되어 근거 있는 답변이 나오도록 검색·답변 품질을 개선하는 작업입니다. 기존 대화형 챗봇 UI는 그대로 유지하며, 화면 디자인 개편, 자체 LLM 개발, 대규모 파인튜닝, 전체 시스템 재구축은 이번 범위에 포함하지 않습니다.
- 본 프로젝트는 정부지원사업비로 진행하며, 대금은 잔금 100% 형태로 지급합니다. 이 조건에 동의하시는 파트너님만 지원해 주시기 바랍니다.
[클라이언트 소개]
- 외국인의 비자·체류 관련 법령과 정책 정보를 제공하는 웹 서비스를 준비 중인 회사입니다. 일반 사용자가 직접 사용하는 고객용 서비스이며, 현재 오픈 준비 단계입니다.
- 프로젝트 의사결정 구조: 대표가 요구사항 확정과 파트너 문의 응대, 계약과 범위 변경 승인까지 직접 하며 별도 결재 절차가 없습니다.
- 개발 지식: 사내 개발자 1명이 서비스 개발을 진행하고 있으나 RAG 영역을 담당하지 않습니다. 이번 프로젝트의 기술 소통과 판단은 대표가 직접 진행하므로, 기술 선택 이유를 비개발자가 이해할 수 있는 수준으로 설명해 주시기 바랍니다.
[왜 이 프로젝트를 하는가]
- 지금 상황: 현재 챗봇은 공식 문서 수집·저장, 벡터 검색, 답변 출처 표시까지 구현되어 있지만, 질문을 하면 제대로 된 답이 나오지 않습니다. 내부 로직이 복잡하게 얽혀 있고 외부 자료를 가져오는 범위도 한정적으로 잡혀 있습니다. 서비스 오픈을 앞두고 있고, 현재 개발 인력이 인수인계를 마친 뒤 이탈할 예정이어서 지금 진단과 개선이 필요합니다.
- 끝나면 이렇게 되기를 바랍니다: 비자·체류 관련 법령과 정책을 물었을 때 관련 공식 문서가 정확히 검색되고, 그 근거에 기반한 답변이 출처와 함께 나오는 상태입니다. 근거가 부족한 질문에는 단정하지 않고 추가 확인이나 전문가 상담으로 연결되어야 합니다. 개선 전후 차이는 평가셋으로 확인할 수 있어야 합니다.
- 다만 이런 점이 우려됩니다: 저희가 보는 것은 결과물 하나입니다. 사용자가 질문했을 때 제대로 된 답이 나오는지입니다. 모델이나 도구를 교체하는 작업으로 3주가 지나고 실제 답변 품질은 그대로일 수 있다는 점이 가장 우려되는 부분입니다.
[필수 과업 범위와 결과물]
1. 수행 범위
- 기획 및 디자인: 신규 화면 기획과 디자인 작업은 없습니다. 기존 대화형 챗봇 UI를 유지하며 UI 개편은 범위에서 제외합니다.
- SW 개발: 기존 Next.js·TypeScript 코드베이스의 RAG 파이프라인 분석 및 수정. 질의 재작성, 검색·필터링·재정렬, 답변 생성 및 인용 로직 개선을 포함합니다.
- 데이터·평가셋 구축: 평가 문항 구성, 검색 정답과 기대 출처 정의, 다국어 문항 포함
- 테스트·QA: 자동 평가 및 회귀 테스트 보완, 대표 질문 end-to-end 테스트
- 문서화 및 인수인계: 진단 보고서, 개선 전후 성능 비교보고서, 운영 가이드 작성 및 최종 시연
- 인프라: 신규 인프라 구축은 포함하지 않습니다. 기존 Supabase 환경을 그대로 사용합니다.
2. 상세 기능 요구 사항
- 상세 과업 정의는 첨부 자료에 함께 있습니다.
2-1. 기존 RAG 시스템 진단
- 파이프라인 분석: 문서 수집, 정규화, chunking, embedding, vector search, reranking, 답변 생성 흐름 전 구간 분석
- 실패 원인 분류: 검색 실패와 답변 생성 실패의 원인 구분 및 유형화
- 기존 자산 검토: 현재 코드 및 기존 평가 환경 검토
- 개선 우선순위 제안: 3주 안에 적용 가능한 항목 선별 및 적용 계획 확정
2-2. 평가셋 구축 및 기준 성능 측정
- 기존 문항 검토: 현재 평가 문항 검토 및 보완
- 평가 문항 구성: 실제 질문 유형을 반영한 익명·합성 문항 구성 (한국어·영어·중국어·베트남어 포함, 약 200건 규모)
- 정답 기준 정의: 검색 정답, 기대 출처, 허용 답변, 답변 보류 조건 정의
- 평가셋 분리: 튜닝용 평가셋과 최종 검수용 독립 평가셋 분리 운영
- 기준 성능 측정: 개선 전 기준 성능 측정 및 개선 후 결과와 정량 비교
2-3. 질문 이해 및 검색 품질 개선
- 질의 재작성: 일상적·모호한 질문의 의도 파악 및 검색 가능한 정책·법률 질의로 변환
- 검색 목적 구분: 대상, 요건, 절차, 서류, 기한 등 질문 유형별 검색 목적 분기
- 다국어 질의 처리: 동의어, 유사 표현 처리 및 4개 언어 질의의 검색 품질 확인·개선
- 검색 방식 개선: vector search, keyword search, metadata filtering을 결합한 hybrid retrieval 검토 및 적용
- 재정렬 개선: reranker 적용 또는 기존 재정렬 로직 개선
- 오검색 감소: 관련 공식 문서의 검색 누락 감소, 유사하지만 다른 제도·법령이 검색되는 문제 개선
2-4. 답변 및 출처 품질 개선
- 근거 기반 답변 생성: 검색된 공식 근거 범위 안에서만 답변 생성, 질문에 직접 대응하는 결론 우선 제시
- 인용 정합성: 답변 문장과 출처 문서·조문 간 대응 관계 개선
- 출처 표기: 공식 출처, 문서명, 시행일·게시일·확인일 표시
- 보수적 답변 처리: 근거 부족, 출처 충돌, 최신성 미확인 시 단정하지 않고 추가 확인 또는 전문가 상담으로 연결
- 안전장치: 개별 신청 가능 여부, 필요서류, 전략을 근거 없이 확정하지 않도록 하는 제어 로직 개선
2-5. 테스트 및 운영 이관
- 자동 평가 보완: 평가 스크립트 및 회귀 테스트 보완
- end-to-end 테스트: 대표 질문 기준 전 구간 테스트
- 실패 사례 기록: 잔여 실패 케이스와 재현 방법 정리
- 운영 문서화: 환경설정, 데이터 갱신, 운영 점검 방법 문서화
- 인수인계: 최종 시연 및 발주사 담당자 인수인계
3. 결과물
- 기존 RAG 시스템 진단보고서
- 개선 우선순위 및 적용 내역
- 평가셋과 평가 기준
- 개선 전후 성능 비교보고서
- 수정된 전체 소스코드 (발주사 소유 저장소)
- 자동 평가 및 회귀 테스트 코드
- 실패 사례와 재현 방법
- 환경설정·배포·데이터 갱신·운영 가이드
- 최종 시연 및 인수인계
- 납품 후 발주사가 소스코드, prompt, 검색 정책, 평가 코드를 직접 수정할 수 있는 상태로 전달해 주세요.
[기술 스택]
- Service: Next.js, TypeScript (기존 코드베이스)
- LLM: 외부 LLM API 연동 (기존)
- DB·검색: Supabase PostgreSQL, pgvector 기반 벡터 검색 (기존)
[클라이언트 준비 사항]
- 준비된 것: Next.js·TypeScript 기반 서비스, LLM API 연동, Supabase PostgreSQL·pgvector 벡터 검색, 공식 문서 수집 및 저장 구조, 답변 출처 표시, 일부 평가 코드
- 준비 중인 것: 서비스 오픈 준비와 개발이 계속 진행 중입니다.
- 제공하지 않는 것: 운영 DB 전체, 운영 비밀키, 실제 사용자 개인정보는 제공하지 않습니다. 상세 코드와 기술자료는 우선협상 또는 계약·비밀유지 절차 후 제한적으로 제공합니다.
- 이 프로젝트 담당: 대표 1명이 요구사항 확정과 검수를 모두 맡습니다.
[오픈 시점과 예산]
- 목표 시점: 10월 15일 이전에 정산을 마쳐야 하므로, 그 전까지 검수까지 완료되어야 합니다. 정부지원사업비 정산 일정이라 조정이 어렵습니다.
- 개발 기간: 약 3주
- 예산: 500만~800만원 (부가세 별도)
- 대금 지급: 본 프로젝트는 정부지원사업비로 진행하며, 대금은 잔금 100% 형태로 지급합니다. 파트너사와 직접 계약하며, 이 지급 조건에 동의하시는 파트너님과 계약을 진행합니다.
[제안 포함 필수 사항]
- 지원 내용은 아래 기준으로 검토합니다.
1. 적합한 기술 접근과 그 선택 이유를 제안에 포함해 주세요. 저희 쪽에 RAG를 판단할 인력이 없으므로 비개발자가 이해할 수 있는 수준으로 적어 주시면 도움이 됩니다.
2. 파트너님께서 판단하시기에 어떤 부분이 완료되어야 이 프로젝트가 성공적으로 마무리되었다고 보시는지 제안에 포함해 주세요. 전문가로서 이 프로젝트의 결과물에 대한 의견 부탁드립니다.
3. 검색 실패 원인을 어떤 지표로 측정하고 개선 전후를 무엇으로 보여주실지, 3주 안에 어느 수준까지 도달 가능하다고 보시는지 제안에 포함해 주세요. 모델이나 도구 교체가 아니라 실제 답변 품질이 달라지는지를 저희가 확인할 수 있어야 해서, 이 부분을 특히 중요하게 보고 있습니다.
4. 실제 투입 인원과 담당 역할, 유사 프로젝트의 구체적인 수행 범위를 제안에 포함해 주세요. 운영 가능한 RAG 시스템 개발 또는 품질 개선 경험, vector search·embedding·hybrid retrieval·reranking 경험, TypeScript·PostgreSQL·pgvector 기반 기존 코드의 분석·수정 경험을 기준으로 검토합니다. 한국어·다국어 RAG 개선 경험과 법률·행정·금융 등 정확성이 중요한 분야의 RAG 경험이 있으시면 함께 적어 주세요.
5. 총비용과 부가가치세 포함 여부, 외부 API·모델·저장소 사용 여부와 그 비용 부담 주체를 제안에 포함해 주세요.