← WORK 목록으로
KOREA위시켓데이터

Python/MySQL 기반 AI 결빙 예측 데이터 파이프라인 엔지니어 전문가

AI 기반 도로 결빙 예측 솔루션을 위한 데이터 파이프라인 전반을 설계·구현하는 프로젝트입니다. 기상청·국토부·도로공사·ITS 등 공공 API와 IoT 센서의 시계열 데이터를 수집·정제하고, 결측치 처리·리샘플링·이상치 필터링 등 품질 관리 로직과 모니터링 대시보드를 구축하여 AI/ML 학습용 데이터셋을 제공합니다. Python 기반 크롤링·데이터 파이프라인 실무 경험과 대용량 MySQL 운영, Airflow 스케줄링 경험을 갖춘 데이터 엔지니어에게 적합합니다.

2026.08.30VIEW 71위시켓에서 수집
Budget3,500,000원
Difficulty고급
Duration2개월
Work style상주
Required stack

필요 기술

PythonMySQLPandasScrapyPlaywrightAirflowTimescaleDBFastAPI
Project brief

프로젝트 내용

프로젝트 소개:
- 자사 프로젝트의 웹 크롤링 및 스크래핑 업무를 수행하며, AI 기반 도로 결빙 예측 솔루션의 데이터 파이프라인 전반을 설계하고 구현하는 프로젝트입니다.
- 공공 API 및 센서 데이터를 수집하고 정제하여 AI/ML 엔지니어가 활용할 수 있는 형태의 학습용 데이터셋으로 구조화합니다.

전체 시스템 구성:
- 개발 언어 및 프레임워크: Python, FastAPI
- 데이터베이스 및 저장소: MySQL, TimescaleDB, InfluxDB, S3
- 수집 및 데이터 처리: Scrapy, Playwright, Selenium, Pandas, NumPy
- 파이프라인 및 스케줄링: Airflow, Prefect, Cron

전체 프로젝트 일정:
- 2개월



모집 인원:
- 경력 3년~5년 1명 (월 350만 원)

상세 업무:
- 자사 다양한 프로젝트에서 발생하는 웹 크롤링·스크래핑 업무
- 이후 'AI 기반 도로 결빙 예측 솔루션'의 데이터 파이프라인 전반 설계·구현
- 기상청·국토부·도로공사·ITS 등 공공 API, PCI/교통사고 DB 등 다종 데이터 소스 수집기 개발 및 운영
- 노면온도, 대기온도, 습도, 이슬점, 수막, 결빙률, 마찰계수 등 시계열 센서 데이터의 수신·저장·정제 파이프라인 구축
- 결측치 처리, 리샘플링, 이상치 필터링, 시간 동기화 등 데이터 품질 관리 로직 설계 및 구현
- 수집 현황·결측·지연·이상치 등을 모니터링할 수 있는 데이터 품질 대시보드 / 알림 구성
- AI/ML 엔지니어가 바로 학습에 활용 가능한 형태로 학습용 데이터셋 정제·라벨 동기화·피처 테이블 제공
- 결빙 발생 패턴, 변수 상관관계 등 EDA 및 KPI 산출 자동화 리포트 작성 (모델 가중치 검증, 운영 지표 자동 집계)
- 백엔드·AI 엔지니어와 협업하여 수집된 데이터가 서비스/모델에 안정적으로 흘러가도록 구조화

필수 기술:
- Python / MySQL / Pandas / Scrapy / Playwright (또는 Selenium) / RESTful API

자격 요건:
- 데이터 엔지니어 또는 데이터 기반 백엔드 개발 경력 3년 이상을 보유하신 분
- Python 기반 데이터 수집, 전처리 및 파이프라인 개발 실무 경험이 있으신 분
- 웹 크롤링/스크래핑 도구 중 하나 이상 실무 활용 경험이 있으신 분
- 외부 OpenAPI 연동 및 대용량 관계형 DB(MySQL 등) 설계, 운영 경험이 있으신 분
- Pandas/NumPy를 활용한 데이터 정제 및 스케줄러(Airflow 등) 활용 작업 자동화 경험이 있으신 분
- 장기 운영을 전제로 한 안정적 파이프라인 구축 경험과 원활한 협업 능력을 갖추신 분

우대 사항:
※ 아래 항목 중 일부 경험만 있어도 지원 가능합니다.
- 시계열 데이터베이스(TimescaleDB, InfluxDB 등) 설계·운영 경험
- IoT/센서 데이터 수신 경험 (MQTT, TCP/Serial, UMB 등 산업용 프로토콜)
- 1분 이하 고빈도 수집·저장 파이프라인 운영 경험
- 데이터 품질 모니터링(SLA, 결측률, 지연, 이상치) 지표 설계 및 알림 시스템 구축 경험
- AWS / NCP(네이버 클라우드) 등 클라우드 환경에서 데이터 인프라 운영 경험
- 기상청, 국토부, 도로공사, 공공데이터포털 등 국내 공공 API 활용 경험
- AI/ML 학습용 데이터셋 구축, 라벨 동기화, 피처 스토어 운영 경험
- BI/대시보드 도구(Metabase, Superset, Grafana 등) 활용한 운영 지표·KPI 자동 리포트 경험
- 데이터 카탈로그·스키마 관리·버전 관리(Great Expectations, dbt 등) 경험
- 토목·교통·도로·기상 등 물리/현장 도메인 데이터를 다뤄본 경험
- 다국어/다지역 데이터 수집 또는 글로벌 서비스 데이터 대응 경험
- 스타트업 또는 초기 단계 프로젝트에서 데이터 파이프라인을 처음부터 잡아본 경험

기타 사항:
- 클라이언트 요청으로 재등록된 공고입니다.
- 예전 프로젝트 : https://www.wishket.com/project/157602/
지원 기회 분석

지원 전에 볼 것

핵심 요구사항

  • Python 기반 데이터 수집·전처리·파이프라인 개발 실무 경험 3년 이상
  • 웹 크롤링/스크래핑 도구(Scrapy/Playwright/Selenium) 실무 활용
  • 외부 OpenAPI 연동 및 대용량 MySQL 설계·운영
  • Pandas/NumPy 데이터 정제 및 Airflow 등 스케줄러 자동화
  • 시계열 센서 데이터 수신·저장·정제 및 데이터 품질 관리 로직 설계
  • 장기 운영 가능한 안정적 파이프라인 구축 및 협업 능력

예상 산출물

  • 다종 공공 API·센서 데이터 수집기
  • 시계열 데이터 정제·품질 관리 파이프라인
  • 데이터 품질 모니터링 대시보드 및 알림 시스템
  • AI/ML 학습용 정제 데이터셋 및 피처 테이블
  • EDA·KPI 산출 자동화 리포트

매력 포인트

  • 상세하고 명확한 업무·기술 스펙
  • 도로 결빙 예측이라는 도메인 특화 데이터 엔지니어링 경험
  • 우대사항 일부만 충족해도 지원 가능

확인할 점

  • 2개월 350만원(월 단가) 대비 요구 범위가 매우 넓고 전문성이 높아 단가가 낮은 편
  • 재등록 공고로 이전 모집이 성사되지 않았을 가능성
  • '자사 다양한 프로젝트의 크롤링 업무'로 업무 범위가 결빙 예측 외로 확대될 여지
Client signal

클라이언트 정보

회사 · 위시켓 / 지역 · 서울특별시 영등포구 / 고용형태 · CONTRACTOR
START THE LOOP · CHOOSE

시장과 사람의 답을 봤다면,
다음 결과물의 구조를 고릅니다.

한 번의 결과에 기대지 않고 다시 만들 수 있도록, 문제 발견부터 제작·배포·수익화까지 이어지는 전체 흐름을 익혀보세요.

TTJ CLASS에서 다음 구조 고르기 →
처리 중...