생물학에서 AI가 변이의 결과를 예측한다는 말은 매력적입니다. 어떤 변화가 단백질을 망가뜨릴지, 어떤 변화가 기능을 유지할지 미리 알 수 있다면 실험의 수를 줄일 수 있기 때문입니다. 그러나 예측이 맞는지 확인할 데이터가 부족하면 모델의 자신감은 지식이 아니라 가설에 머뭅니다.

2026년 7월 26일 bioRxiv에 올라온 연구는 이 문제를 아주 작은 모델 시스템에서 정면으로 시험했습니다. 연구 대상은 박테리아를 감염하는 박테리오파지 ΦX174입니다. 이 바이러스는 5,386개의 뉴클레오타이드로 된 원형 단일가닥 DNA 게놈과 11개의 단백질을 가지며, 1970년대에 처음 게놈이 염기서열 분석됐고 2000년대에는 화학적으로 합성된 최초의 게놈이 됐습니다. 오래 연구된 시스템이므로 예측 모델에게는 비교적 유리한 시험장입니다.

거의 전부 바꿔 보고, 다시 측정하기

연구팀은 ΦX174 게놈의 단일 뉴클레오타이드 변화와 단백질의 단일 아미노산 변화를 체계적으로 만들어, 총 44,195개 변이의 적합도 효과를 측정했습니다. 여러 생물학적 반복 측정의 결과도 서로 높은 일치도를 보였습니다. 여기서 적합도는 변이가 정해진 실험 조건에서 바이러스의 증식 능력에 어떤 영향을 주는지를 뜻합니다. 사람의 건강이나 자연환경에서의 성공을 직접 측정한 값은 아닙니다.

결과는 단순한 ‘대부분의 변화는 괜찮다’와 거리가 있었습니다. 단일 뉴클레오타이드 변이의 절반 이상과 아미노산 변이의 60% 이상이 바이러스의 적합도를 낮췄습니다. 동시에 소수의 변화는 해당 실험 조건에서 적합도를 높였습니다. 한 위치가 중요해 보인다는 직관만으로는 충분하지 않고, 같은 변화도 게놈의 다른 기능과 겹치는지, 단백질의 다른 부분과 상호작용하는지를 함께 봐야 한다는 뜻입니다.

단백질은 혼자 작동하지 않는다

연구팀이 구조 정보와 변이 결과를 겹쳐 보자, 손상을 일으킨 아미노산 변화의 약 절반은 단백질과 다른 분자 사이의 상호작용 영역에 놓였습니다. 단백질 내부의 핵심부에 해당하는 변화는 약 4분의 1이었습니다. 연구팀의 분류에서는 상호작용 영역과 단백질 핵심부가 손상 변이의 약 73%를 설명했습니다.

이 결과는 단백질을 접힌 하나의 물체로만 보는 관점에 제동을 겁니다. 단백질이 스스로 안정하게 접히는 것만큼, 다른 단백질·DNA·숙주 세포의 요소와 올바르게 만나는 것도 중요합니다. 연구팀은 이런 변이를 개별 단백질의 붕괴보다 ‘연결부’의 붕괴로 이해할 수 있다고 설명합니다. 생물학적 기능은 부품 목록이 아니라 관계의 네트워크에서 생깁니다.

하지만 구조를 알아도 설명이 완성되지는 않았습니다. 손상된 단백질 변이의 약 27%는 명확한 분자적 메커니즘을 붙이지 못했습니다. 구조 정보가 제한된 영역도 있었고, 기존 주석에 포함되지 않은 상호작용이나 조절 기능일 가능성도 남았습니다. 아주 오래 연구된 작은 바이러스에서도 ‘왜 안 되는가’를 모르는 변화가 상당수 남은 것입니다.

AI는 실패했나, 아니면 시험이 부족했나

연구팀은 단백질 언어 모델, 진화 정보 모델, 구조를 함께 쓰는 모델 등 여러 변이 효과 예측기를 실험값과 비교했습니다. 결과는 AI가 아무것도 예측하지 못했다는 식의 실패가 아니었습니다. 일부 모델은 의미 있는 상관을 보였지만, 많은 모델은 단백질 복합체의 상대적 용매 접근성처럼 비교적 단순한 구조 기반 기준선보다도 잘 작동하지 않았습니다. 연구팀이 보고한 복합체 기반 기준선의 단백질별 중앙 Spearman 상관계수는 0.41이었고, 평가된 예측기 가운데 이를 넘은 것은 일부에 그쳤습니다.

이 비교가 흥미로운 이유는 모델의 크기보다 시험의 위치가 더 선명해지기 때문입니다. ΦX174는 모델이 학습한 일반적인 단백질 분포와 다를 수 있고, 바이러스 서열이 학습 자료에서 충분히 대표되지 않았을 수 있습니다. 즉 낮은 성능은 ‘AI는 생물학을 못 한다’는 보편 명제가 아니라, 학습 분포 밖의 생물학적 시스템을 독립적인 실험 자료로 평가해야 한다는 신호입니다.

실험은 모델의 경쟁자가 아니라 번역기다

이번 연구는 AI를 폐기하자는 기록이 아닙니다. 변이 지도와 구조 모델을 함께 사용했을 때, 연구팀은 기존에 분명하지 않았던 분자 상호작용에 관한 가설을 세울 수 있었습니다. 예측은 실험을 대체하지 못했지만, 실험 결과와 결합하면서 다음 질문을 고르는 도구가 됐습니다.

다만 범위는 엄격히 제한해야 합니다. 이 연구는 아직 동료평가를 거치지 않은 preprint이며, 박테리아를 감염하는 작은 모델 바이러스와 제한된 실험 조건을 다룹니다. 이 결과만으로 사람의 유전체, 복잡한 병원체, 또는 실제 환경에서의 변이 효과를 예측할 수 있다고 말할 수는 없습니다. 연구에 등장하는 생물학적 세부 절차와 서열을 재현하는 것도 이 기록의 목적이 아닙니다.

이번 기록에서 오래 남는 문장은 ‘AI가 답을 냈다’가 아닙니다. 예측의 품질은 모델의 출력만으로 결정되지 않고, 모델이 맞는지 틀리는지를 판별할 독립적인 측정 설계에 의해 결정됩니다. 거의 모든 변이를 시험한 뒤에도 설명되지 않는 부분이 남았다면, 다음 단계는 더 큰 확신이 아니라 더 좋은 측정과 더 정직한 불확실성 표기입니다.

출처와 상태