TECH 으로 돌아가기
TECH HACKER NEWS 오늘 7분 읽기 23 READS

18억 달러가 겨냥하는 'AI용 생물학 데이터': 가상 세포를 향한 공동 투자

18억 달러가 겨냥하는 'AI용 생물학 데이터': 가상 세포를 향한 공동 투자
SOURCE IMAGE · HACKER NEWS

생명과학과 인공지능의 접점에서 지금까지 나온 투자 가운데 가장 규모가 큰 공동 선언이 2026년 10월 7일 미국 캘리포니아 레드우드시티에서 나왔다. 비영리 연구기관 Biohub가 미국 에너지부(DOE), 국립보건원(NIH), 그리고 신규 자금 파트너들과 함께 생물학의 예측 AI 모델을 뒷받침할 데이터를 생성·공개하기 위한 국제 협력을 대폭 확대한다고 밝혔다. 자금, 데이터, 연산 자원, 신규 측정 기술을 합쳐 총 18억 달러가 투입되며, 주최 측은 이를 'AI에 바로 쓸 수 있는(AI-ready) 생물학 데이터'를 만들기 위한 역대 최대 규모의 조율된 약속이라고 설명했다.

이번 발표의 핵심은 모델 자체가 아니라 그 모델을 훈련시킬 '데이터'에 돈과 인프라를 모았다는 점이다. 목표는 세포가 특정 개입(intervention)에 어떻게 반응하는지를 디지털로 예측하는 모델, 이른바 '가상 세포(virtual cell)'를 구축하는 것이다. Biohub의 과학 총괄 Alex Rives는 정확한 예측 모델이 실험을 디지털로 수행할 수 있게 해 과학적 발견을 크게 앞당길 수 있으며, 가상 세포 구현은 다음 시대 과학의 가장 중요한 과제 중 하나라고 말했다. 이 작업은 한 기관이 감당할 수 없는 규모의 데이터 생성을 요구하기 때문에 여러 주체가 모였다는 것이 이들의 설명이다.

공공과 민간이 나눠 맡은 역할

자금 구성을 뜯어보면 각 주체의 역할이 비교적 뚜렷하게 나뉜다. DOE는 실험실 측정·모델링·연산 분야에 5년간 5억 달러 이상을 투입한다. 이는 에너지부가 주도하는 범부처 사업 'Genesis Mission'을 통해 이뤄지며, 엑사스케일 슈퍼컴퓨팅, X선·중성자 산란, 극저온 전자현미경(cryo-EM) 및 토모그래피, 국립연구소망의 자율 실험실을 동원한다. NIH는 과거 5억 달러 이상의 연방 투자로 축적된 데이터셋·리포지토리·지식베이스를 'Bio Genesis Mission'으로 모으고, Biohub가 이를 AI 모델 훈련에 맞게 표준화하는 작업을 함께 맡는다. NIH 산하 국립의학도서관(NLM)과 국립생명공학정보센터(NCBI)가 정리한 저장소, 이미 생물학 지도와 공통 데이터 표준을 개발 중인 Common Fund 프로그램이 기반이 된다.

민간에서는 Google DeepMind, Isomorphic Labs, Meta가 가상 생물학 이니셔티브(Virtual Biology Initiative)에 총 3억 달러를 투자한다. 2026년 4월 발표된 이 이니셔티브는 Biohub의 창립 자금 5억 달러가 중심을 이루는데, 이 가운데 4억 달러는 세포 내부를 원자 수준에 가깝게 해상하는 cryo-ET, 생체 조직에서 수백만~수십억 개 세포를 촬영하는 현미경, 분자·세포·조직·개체 수준에서 생물학을 조작하는 공학 도구 등 측정 기술 확장에, 나머지 1억 달러는 Biohub 외부 연구에 쓰인다. 여기에 NVIDIA가 가속 컴퓨팅 인프라와 도메인 소프트웨어로 참여하고, Renaissance Philanthropy가 데이터 생성 자금 확대를 돕는다.

실무자가 주목할 지점: '데이터 공용 기반'

IT·데이터 실무자 관점에서 이 프로젝트의 핵심 가치는 개별 모델이 아니라 상호운용 가능한 데이터 계층에 있다. Biohub는 여러 기관의 데이터셋이 하나처럼 작동하도록 공유 표준, 공통 식별자, 단일 접근점을 구축하는 역할을 맡겠다고 밝혔다. Google DeepMind의 Pushmeet Kohli는 이 투자가 개방적이고 표준화된 '데이터 공용재(data commons)'를 만들어 전 세계 연구자가 생물학을 더 잘 모델링할 토대가 될 것이라고 말했다. 실제로 Biohub는 지난 10년간 Tabula Sapiens, OpenCell, Zebrahub 같은 개방형 데이터 프로젝트와 CELLxGENE, CryoET Data Portal 같은 커뮤니티 데이터 인프라를 운영해 왔는데, 이번 이니셔티브는 그 경험 위에 세워진다. 데이터 표준화와 식별자 체계, 단일 API 수준의 접근성이 AI 학습 데이터의 실질적 품질을 좌우한다는 점은 어느 분야에서나 통하는 교훈이다.

여기에 Allen Institute, Broad Institute, Gladstone Institutes, Human Cell Atlas, Human Protein Atlas, Wellcome Sanger Institute 등 인간 유전체 프로젝트 이래 대규모 국제 협업을 조직해 온 기관과 컨소시엄이 과학계를 결집하는 데 합류했다. 이들은 이니셔티브의 일원으로, 또 독립적인 노력을 통해 공동 목표를 추진한다.

과장을 걷어내고 본다면

다만 숫자의 크기만큼 성과가 보장되는 것은 아니다. 이번 발표는 '가상 세포'를 완성했다는 선언이 아니라, 그것을 훈련할 데이터와 측정 기술에 자본을 투입하겠다는 약속이다. NIH의 Nicole Kleinstreuer가 말한 '어떤 세포든 개입에 대한 반응을 예측하는 보편 세포 모델'은 여전히 목표이자 가정이며, 아직 연구되지 않은 세포 유형과 조건으로 반응 데이터를 넓혀야 비로소 가능해진다. Isomorphic Labs의 Max Jaderberg가 '어떤 단일 조직의 생산 한계를 넘어서는 규모'를 강조한 대목은 역설적으로 이 과제의 난도를 보여준다. 서로 다른 기관의 측정 방식과 데이터 형식을 하나의 표준으로 수렴시키는 일, 그리고 그 데이터를 지속적으로 개방·유지하는 거버넌스가 18억 달러 못지않게 성패를 가를 변수다. 한국의 데이터·AI 현장이 참고할 대목도 결국 여기에 있다. 규모 있는 공동 투자가 성과로 이어지려면 측정의 양적 확장만큼이나 표준·식별자·접근성이라는 '보이지 않는 기반'이 함께 설계돼야 한다는 점이다.

SOURCE · HACKER NEWS
원문 전체 보기 → https://biohub.org/news/virtual-biology-initiative-expansion...
SHARE
NEXT · CHOOSE

변화를 읽었다면,
내가 만들 수익 구조를 고릅니다.

정보를 더 모으는 데서 멈추지 않고, 광고·외주·판매·중개·구독 중 내 상황에 맞는 출발점을 정해보세요.

21가지 수익 구조 살펴보기 →
처리 중...