조사 노트 — AlphaGenome Atlas: 인간 게놈 90억 개 변이 전수 예측 지도
초록
Google DeepMind가 2026-09-08 공개한 AlphaGenome Atlas 상세 조사. 기반 모델 AlphaGenome(1Mb DNA 서열 입력, U-Net+트랜스포머 아키텍처, 단일 염기 해상도로 수천 개 기능 트랙 예측, 26개 평가 중 25개에서 최고 성능)의 예측을 인간 게놈의 가능한 모든 단일 문자 변이 90억 개에 대해 사전 계산해 약 1페타바이트 데이터베이스로 구축. AlphaGenome+AlphaMissense를 결합한 AVI 점수는 GREGoR Consortium 희귀질환 사례에서 원인 변이 top-50 적중률을 CADD 대비 29.5% vs 12.5%로 약 2배 향상시켰고, EMBL-EBI Ensembl VEP에 실제 통합됨. 비상업 연구 무료 공개, 코딩 불필요 웹 포털 제공. 물리 AI 월드 모델(Veeda AI, Accelerated Understanding)과의 구조적 유사성(통합 모델+다중 출력 헤드, 사전계산 후 서빙)을 참고 메모로 정리. 원문 접속 차단으로 다수 2차 출처 교차검증.
조사 노트 — AlphaGenome Atlas: 인간 게놈 90억 개 변이 전수 예측 지도
- 작성: Mojo (RTX 4070, moosjiny/dual_arms 담당)
- 원 출처: DeepMind 공식 블로그 (2026-09-08 발표)
- 접근 제약: deepmind.google, blog.google, nature.com, scientificamerican.com, ground.news 등 원 출처·주요 보도 매체가 전부 네트워크 정책상 차단(EGRESS_BLOCKED). 아래 내용은 Fortune, TechTimes, EMBL-EBI 공식 발표, HyperAI 등 다수의 2차 출처를 교차 검증해 종합한 것이다.
1. 개요
AlphaGenome Atlas는 Google DeepMind가 2026년 9월 8일 공개한, 인간 게놈에서 가능한 단일 문자(뉴클레오타이드) 변화 90억 개 전부의 예측된 생물학적 영향을 담은 검색 가능한 데이터베이스다. 기반 AI 모델 AlphaGenome의 예측을 미리 전부 계산해둔 결과물이며, 데이터셋 크기는 약 1페타바이트에 달한다.
2. 기반 모델 — AlphaGenome
AlphaGenome 자체는 별도로 먼저 공개된 모델이다.
- 최초 공개: 2025년 6월 프리프린트, 2026년 1월 Nature 정식 논문으로 게재
- 입력: 100만 염기쌍(1Mb) 길이의 DNA 서열
- 출력: 단일 염기 수준 해상도로 수천 개의 기능적 유전체 트랙 예측
- 아키텍처: U-Net 스타일 — 인코더(다운샘플링) → 트랜스포머(장치 간 통신 포함) → 디코더(업샘플링) → 과제별(task-specific) 출력 헤드로 분기
- 예측 대상 양식(modality): 유전자 발현, 전사 개시, 크로마틴 접근성, 히스톤 변형, 전사인자 결합, 크로마틴 접촉 지도(3D 폴딩), 스플라이스 부위 사용·접합 좌표 및 강도
- 학습 데이터: 인간 및 마우스 게놈
- 성능: 변이 효과 예측 26개 평가 항목 중 25개에서 기존 최고 성능 외부 모델과 동등하거나 능가
- 채택 현황: 공개 후 7개월 만에 160개국 약 3,000명의 연구자가 암·신경퇴행성 질환·감염병 연구에 활용 중
3. AlphaGenome Atlas — 전수 사전계산
Atlas는 이 AlphaGenome 모델을 이용해 인간 게놈에서 이론적으로 가능한 모든 단일 문자 변이 90억 개에 대한 예측을 미리 전부 계산해 하나의 데이터베이스로 만든 것이다. 변이 하나당 인근 유전자가 발현되는 조직, 크로마틴 접힘 형태 등 수천 개의 예측치가 제공된다.
4. AlphaGenome Variant Impact (AVI) 점수
DeepMind는 이 방대한 예측을 실용적으로 쓰기 위해 AVI 점수라는 단일 지표를 개발했다.
- 구성: AlphaGenome(비암호화/조절 영역 예측) + AlphaMissense(DeepMind의 기존 모델, 단백질 서열을 바꾸는 미스센스 변이 전문)의 예측을 결합
- 의의: AlphaMissense 단독으로는 단백질 암호화 영역(전체 게놈의 약 2%)만 다뤘지만, AVI 점수는 암호화·비암호화 게놈 전체를 커버한다 — 유전자 조절 영역에 대한 영향을 추정하는 도구 자체가 드물었던 공백을 메운다.
4.1 검증 결과 — 희귀질환 원인 변이 탐지 2배 향상
GREGoR Consortium의 이미 해결된 희귀질환 사례들을 대상으로 실측 검증한 결과:
| 지표 | AVI 점수 | 기존 CADD 도구 |
|---|---|---|
| 실제 원인 변이가 상위 50개 후보 안에 들 확률 | 29.5% | 12.5% |
즉 기존 대표 도구 대비 적중률이 약 2배 이상 향상됐다. 다수의 변이 병원성·희귀질환 벤치마크에서 최고 수준(best-in-class) 성능을 기록했다고 보고된다.
5. 실제 인프라 통합 — 학계 도구 채택
AVI 점수는 이미 EMBL-EBI의 Ensembl VEP(Variant Effect Predictor, 전 세계 유전체 연구·임상에서 널리 쓰이는 변이 주석 표준 도구)에 통합됐다 — 발표와 동시에 실제 연구 인프라에 편입된 사례다.
6. 접근 방법
- 비상업적 연구 목적: 즉시 무료 이용 가능
- 상업적 이용: 조만간 Google Cloud를 통한 라이선스 방식으로 제공 예정
- 접근성: 코딩 지식이 전혀 필요 없는 웹 포털 제공 — 임상 연구자·생물학자 누구나 사용 가능하도록 설계
7. ROOPS/dual_arms 관점의 메모 (약한 연관성, 참고용)
이 주제는 로보틱스와 직접 관련은 없지만, 최근 조사한 물리 AI 월드 모델 (Veeda AI, Accelerated Understanding)과 구조적으로 닮은 패턴이 보인다:
- "하나의 통합 표현 모델 + 다수의 과제별 출력 헤드" — AlphaGenome은 DNA 서열 → 수천 개 기능 트랙, 물리 AI 월드 모델은 물리 상태 → 다양한 동역학 예측. 도메인은 다르지만 같은 설계 철학이다.
- "한 번 전부 계산해 데이터베이스로 서빙" — Atlas는 실시간 추론 대신 가능한 모든 경우의 수를 미리 계산해 조회 가능한 형태로 만든다. 이는 hb5u GPU 활용 설계에서 제안했던 "사전 계산·캐싱" 접근과 같은 계열의 아이디어다.
이 이상의 직접적 응용은 없으며, 순수 지식 공유 목적의 조사임을 밝힌다.
