← WORK 목록으로
KOREA위시켓AI/ML

AI 기반 문서 영상 자동생성 개발 전문가

PDF 전문 문서 1건을 입력하면 내용을 분석·구조화해 대본과 스토리보드를 만들고, LLM·이미지/영상 생성 AI·TTS를 조합해 30초~1분 분량의 MP4 설명 영상을 자동 생성하는 워크플로우를 개발하는 프로젝트입니다. 웹 UI 업로드, PDF 파싱, 다중 LLM(GPT·Claude·Gemini) 연동, Veo·Kling·Runway 등 영상 생성 API 연동, FFmpeg/Remotion 기반 씬별 미디어 합성 및 렌더링까지 전체 파이프라인을 구현해야 합니다. 여러 생성형 AI API를 오케스트레이션하고 미디어 합성 자동화에 능숙한 백엔드 중심 풀스택 개발자에게 적합합니다.

2026.09.01VIEW 59위시켓에서 수집
Budget6,000,000원
Difficulty고급
Duration1~2개월
Work style외주
Required stack

필요 기술

PythonGPT APIClaude APIGemini APIFFmpegRemotionVeo/Kling/Runway APITTS
Project brief

프로젝트 내용

[프로젝트 개요]
- 전문 PDF 문서 1건을 입력하면 문서 내용을 분석하고 구조화하여 대본 및 스토리보드를 생성한 뒤, LLM과 이미지 및 영상 생성 AI, TTS를 결합해 30초에서 1분 분량의 MP4 설명 영상을 자동 생성하는 워크플로우 개발 프로젝트입니다.

[프로젝트 배경 및 목표]
- AI 모델 자체를 새로 개발하거나 학습시키는 것이 아닌, 기존 LLM(GPT, Claude, Gemini)과 영상 생성 AI를 적절히 조합하여 하나의 자동화 워크플로우로 구현하는 것이 핵심입니다. 초기 개발 범위는 단일 PDF 입력 및 단일 영상 자동 생성으로 한정하며, 다수 문서 일괄 처리나 결제 등의 대규모 플랫폼 기능은 제외합니다. 기능을 과도하게 확장하기보다 정확성과 시각적 완성도를 갖춘 영상 한 건이 안정적으로 생성되는 것을 우선 목표로 합니다.

[과업 범위]
1. 수행 범위
- AI 파이프라인 및 아키텍처 상세 기획
- 사용자 입력 및 확인용 Web UI 프론트엔드 개발
- LLM, 영상, 이미지, TTS 외부 API 연동 백엔드 개발
- 영상 합성 및 렌더링 서버 구성

2. 상세 기능 요구 사항
2-1. 사용자 입력 및 제어 환경 구축
- 사용자가 문서를 업로드할 수 있는 웹 UI 화면 구현
- PDF 파일의 Drag and Drop 입력 기능 적용
- 시청자 이해 수준에 따라 General Level(비전문가용) 및 Expert Level(전문가용 기술 중심) 영상 구성 선택 기능 제공
- 영상 길이를 20초에서 30초 또는 60초 등으로 설정할 수 있는 옵션 기능 제공
- 프롬프트 및 주요 생성 규칙을 코드 수정 없이 사용자가 변경하고 추가할 수 있는 관리 기능 적용

2-2. 문서 분석 및 프롬프트 처리
- 입력된 PDF 텍스트 데이터 파싱 및 내용 구조화 처리
- GPT, Claude, Gemini 계열 LLM API를 연동하여 분석 로직 적용
- 원문 근거를 바탕으로 내용을 검증하여 정보 환각 현상 최소화 로직 구현

2-3. AI 에셋 및 영상 소스 생성
- 분석된 구조화 데이터를 기반으로 영상 대본 및 스토리보드 자동 생성
- 이미지 생성 AI API를 연동하여 장면에 맞는 시각 자료 생성
- Veo, Kling, Runway, Gemini 계열 영상 생성 AI 또는 유사 API를 연동하여 동영상 소스 생성
- 텍스트 대본을 바탕으로 TTS 음성 파일 자동 생성
- 대본 기반의 영상 텍스트 자막 데이터 자동 생성
- 향후 한국어 및 영어 다국어 영상으로 확장 가능한 데이터 구조 설계

2-4. 미디어 합성 및 출력 파이프라인
- FFmpeg, Remotion 또는 유사 라이브러리를 활용한 영상 합성 자동화 로직 구현
- 도면 데이터, 생성된 이미지, 모션 그래픽, 생성형 영상 소스, TTS 음성, 텍스트 자막을 씬(Scene)별로 동기화하여 자동 합성 적용
- 최종 결과물을 MP4 파일 포맷으로 자동 출력
- 각 API 호출 및 렌더링 단계에서 생성 실패 시 재생성 처리 및 예외 오류 처리 로직 적용

[기술/제조 스택]
Python, GPT API, Claude API, Gemini API, Veo API, Kling API, Runway API, FFmpeg, Remotion

[클라이언트 준비 사항]
1. 문서 및 자료
- 테스트용 대상 PDF 전문 문서 (NDA 체결 후 제공)
- 초기 설정용 프롬프트, 생성 규칙, 워크플로우 초안 문서
2. 투입 인력 및 조직
- 개발 기간 중 결과물을 수시로 확인하고 즉시 피드백을 제공할 발주자 전담 인력

[주요 일정]
1. 희망 착수일: 파트너 선정 및 협의 후 즉시 착수
2. 주요 마일스톤: 웹 UI 구현 및 PDF 파싱 완료, LLM 및 소스 생성 API 연동 완료, 영상 합성 엔진 통합 및 테스트 완료
3. 최종 오픈(납품) 희망일: 파트너와 개발 기간 협의 후 확정

[산출물]
- 웹 UI 및 AI 워크플로우 전체 소스 코드 (Git 리포지토리 기반 납품)
- 시스템 주요 구조 및 프롬프트 관리 방법에 대한 운영 가이드 문서


[계약 관련 특이 사항]
본 프로젝트의 예산 범위: 600만~1,200만 원
지원 기회 분석

지원 전에 볼 것

핵심 요구사항

  • PDF 텍스트 파싱 및 내용 구조화, 환각 최소화 검증 로직 구현
  • GPT·Claude·Gemini 등 다중 LLM API 연동 및 대본/스토리보드 자동 생성
  • Veo·Kling·Runway 등 영상 생성 AI, 이미지 생성, TTS API 연동
  • FFmpeg/Remotion 기반 씬별 미디어 동기화·합성 및 MP4 자동 출력
  • PDF 드래그앤드롭 업로드 및 옵션 선택용 웹 UI 프론트엔드 개발
  • API/렌더링 실패 시 재생성 및 예외 처리, 프롬프트 무코드 관리 기능

예상 산출물

  • 웹 UI 및 AI 워크플로우 전체 소스 코드 (Git 리포지토리 납품)
  • 시스템 구조 및 프롬프트 관리 운영 가이드 문서
  • PDF 입력 기반 MP4 영상 자동 생성 파이프라인

매력 포인트

  • 과업 범위와 상세 기능 요구가 비교적 명확
  • 최신 생성형 AI 스택을 다루는 포트폴리오형 프로젝트
  • 단일 PDF·단일 영상으로 초기 범위를 한정해 스코프가 통제됨

확인할 점

  • 다수 생성형 AI API 연동·미디어 합성 범위 대비 30일·600만원 예산과 기간이 빠듯함
  • 영상 생성 AI API 사용료 등 외부 API 비용 부담 주체가 불명확
  • '정확성과 시각적 완성도' 등 결과 품질 기준이 주관적이라 검수 분쟁 소지
Client signal

클라이언트 정보

회사 · 위시켓 / 지역 · 서울특별시 강남구 / 고용형태 · CONTRACTOR
START THE LOOP · CHOOSE

시장과 사람의 답을 봤다면,
다음 결과물의 구조를 고릅니다.

한 번의 결과에 기대지 않고 다시 만들 수 있도록, 문제 발견부터 제작·배포·수익화까지 이어지는 전체 흐름을 익혀보세요.

TTJ CLASS에서 다음 구조 고르기 →
처리 중...