원본 기사
MIT, 'AI 거대화 만능론'에 제동…LLM 성능정체는 수학적 한계 때문
지난 10년간 인공지능 업계는 '모델을 키우면 똑똑해진다'는 단순한 공식을 믿고 대규모 컴퓨팅과 데이터에 막대한 투자를 이어왔다. 그러나 매사추세츠공과대학교(MIT) 연구진의 최신 이론 연구는 이 무차별적 확장 전략이 우연한 기술적 장벽이 아니라 근본적인 수학적 한계에 부딪히고 있다고 지적했다.
개념을 담을 공간의 한계
연구진에 따르면 언어모델은 학습한 개념들을 고차원 임베딩 공간의 벡터로 저장한다. 그러나 자연어에는 수만 개의 서로 다른 개념이 존재하는 반면, GPT-3 같은 모델의 표현 공간은 약 12,288차원에 불과해 개념마다 고유한 방향을 할당할 여유가 없다. 이 때문에 모델은 여러 개념을 겹치는 방향에 압축해 저장하는 '중첩(superposition)' 방식을 쓴다.
중첩이 낳는 부작용
중첩은 적은 파라미터로 방대한 지식을 담을 수 있어 효율적이지만, 대가로 '크로스토크'라는 간섭 현상을 낳는다. 예컨대 모델이 '코끼리' 개념을 활성화할 때 인접한 방향에 저장된 '풍선'이나 '은행' 같은 무관한 개념이 함께 반응할 수 있다는 것이다. 연구진은 이런 벡터 간섭이 실제로는 미묘한 환각, 추론 오류, 취약한 일반화로 나타난다고 설명했다.
자본만으로는 못 넘는 벽
연구진은 모델의 폭(파라미터 수)뿐 아니라 깊이, 학습 시간까지 세 축 모두에서 기하학·통계·최적화상의 근본적 장벽이 존재한다고 밝혔다. 폭을 넓히면 중첩된 벡터들이 퍼질 기하학적 공간이 늘어나 성능이 일부 개선되지만, 이는 한계를 늦출 뿐 근본적으로 없애지는 못한다는 것이다. 이는 자본과 컴퓨팅 투자만으로 인간 수준 지능에 도달할 수 있다는 업계의 오랜 가정에 의문을 던진다.
*출처: UNU | United Nations University (2026-09-20)*
관련 기사
📧 뉴스레터 구독
매일 아침 글로벌 뉴스 브리핑을 이메일로 받아보세요.
아직 무료입니다.



