Project brief
프로젝트 내용
[프로젝트 개요]
- 전문 PDF 문서 1건을 입력하면 문서 내용을 분석하고 구조화하여 대본 및 스토리보드를 생성한 뒤, LLM과 이미지 및 영상 생성 AI, TTS를 결합해 30초에서 1분 분량의 MP4 설명 영상을 자동 생성하는 워크플로우 개발 프로젝트입니다.
[프로젝트 배경 및 목표]
- AI 모델 자체를 새로 개발하거나 학습시키는 것이 아닌, 기존 LLM(GPT, Claude, Gemini)과 영상 생성 AI를 적절히 조합하여 하나의 자동화 워크플로우로 구현하는 것이 핵심입니다. 초기 개발 범위는 단일 PDF 입력 및 단일 영상 자동 생성으로 한정하며, 다수 문서 일괄 처리나 결제 등의 대규모 플랫폼 기능은 제외합니다. 기능을 과도하게 확장하기보다 정확성과 시각적 완성도를 갖춘 영상 한 건이 안정적으로 생성되는 것을 우선 목표로 합니다.
[과업 범위]
1. 수행 범위
- AI 파이프라인 및 아키텍처 상세 기획
- 사용자 입력 및 확인용 Web UI 프론트엔드 개발
- LLM, 영상, 이미지, TTS 외부 API 연동 백엔드 개발
- 영상 합성 및 렌더링 서버 구성
2. 상세 기능 요구 사항
2-1. 사용자 입력 및 제어 환경 구축
- 사용자가 문서를 업로드할 수 있는 웹 UI 화면 구현
- PDF 파일의 Drag and Drop 입력 기능 적용
- 시청자 이해 수준에 따라 General Level(비전문가용) 및 Expert Level(전문가용 기술 중심) 영상 구성 선택 기능 제공
- 영상 길이를 20초에서 30초 또는 60초 등으로 설정할 수 있는 옵션 기능 제공
- 프롬프트 및 주요 생성 규칙을 코드 수정 없이 사용자가 변경하고 추가할 수 있는 관리 기능 적용
2-2. 문서 분석 및 프롬프트 처리
- 입력된 PDF 텍스트 데이터 파싱 및 내용 구조화 처리
- GPT, Claude, Gemini 계열 LLM API를 연동하여 분석 로직 적용
- 원문 근거를 바탕으로 내용을 검증하여 정보 환각 현상 최소화 로직 구현
2-3. AI 에셋 및 영상 소스 생성
- 분석된 구조화 데이터를 기반으로 영상 대본 및 스토리보드 자동 생성
- 이미지 생성 AI API를 연동하여 장면에 맞는 시각 자료 생성
- Veo, Kling, Runway, Gemini 계열 영상 생성 AI 또는 유사 API를 연동하여 동영상 소스 생성
- 텍스트 대본을 바탕으로 TTS 음성 파일 자동 생성
- 대본 기반의 영상 텍스트 자막 데이터 자동 생성
- 향후 한국어 및 영어 다국어 영상으로 확장 가능한 데이터 구조 설계
2-4. 미디어 합성 및 출력 파이프라인
- FFmpeg, Remotion 또는 유사 라이브러리를 활용한 영상 합성 자동화 로직 구현
- 도면 데이터, 생성된 이미지, 모션 그래픽, 생성형 영상 소스, TTS 음성, 텍스트 자막을 씬(Scene)별로 동기화하여 자동 합성 적용
- 최종 결과물을 MP4 파일 포맷으로 자동 출력
- 각 API 호출 및 렌더링 단계에서 생성 실패 시 재생성 처리 및 예외 오류 처리 로직 적용
[기술/제조 스택]
Python, GPT API, Claude API, Gemini API, Veo API, Kling API, Runway API, FFmpeg, Remotion
[클라이언트 준비 사항]
1. 문서 및 자료
- 테스트용 대상 PDF 전문 문서 (NDA 체결 후 제공)
- 초기 설정용 프롬프트, 생성 규칙, 워크플로우 초안 문서
2. 투입 인력 및 조직
- 개발 기간 중 결과물을 수시로 확인하고 즉시 피드백을 제공할 발주자 전담 인력
[주요 일정]
1. 희망 착수일: 파트너 선정 및 협의 후 즉시 착수
2. 주요 마일스톤: 웹 UI 구현 및 PDF 파싱 완료, LLM 및 소스 생성 API 연동 완료, 영상 합성 엔진 통합 및 테스트 완료
3. 최종 오픈(납품) 희망일: 파트너와 개발 기간 협의 후 확정
[산출물]
- 웹 UI 및 AI 워크플로우 전체 소스 코드 (Git 리포지토리 기반 납품)
- 시스템 주요 구조 및 프롬프트 관리 방법에 대한 운영 가이드 문서
[계약 관련 특이 사항]
본 프로젝트의 예산 범위: 600만~1,200만 원