COMPRESSION · PREDICTION · CONTROL
지능의 본질은
압축이다
The essence of intelligence.
첫 장부터 읽기목차 펼치기
매니폴드 가설: 중요한 데이터는 기하학적으로 모여있다
AI와 정보 이론을 관통하는 직관 중에
‘매니폴드 가설’이라는 것이 있습니다.
현실 세계의 데이터는
참 놀라울 정도로 복잡하고 차원이 높죠.
고해상도 이미지 한 장이 품고 있는 수백만 개의 픽셀,
혹은 우리가 쓰는 언어나 행동 궤적만 보아도
상상하기 힘들 만큼 거대한 공간을 차지하고 있으니까요.
하지만 유의미한 데이터는
그 광활한 공간에 균등하게 퍼져 있지 않습니다.
오히려 아주 특수한 구조를 띤 좁은 영역에
압축되어 존재합니다.
무작위로 만들어낸 백만 개의 픽셀이
우연히 사람의 얼굴을 형상화할 리는 없겠죠.
우리가 보는 현실의 이미지는
원근법, 조명, 객체의 구조, 심지어 물리 법칙까지
수많은 제약 조건들이 겹겹이 쌓여 만들어진 결과물이기 때문입니다.
이처럼 고차원의 데이터 속에 웅크리고 있는
‘낮은 복잡도의 구조’를
기하학적으로 그려낸 것이 바로 매니폴드입니다.
AI가 이토록 성공적인 이유를 한마디로 요약하자면,
현실의 데이터가 무의미한 노이즈의 덩어리가 아니라
분명한 규칙과 궤적을 가지고 있다는 사실,
바로 그 지점에 있습니다.
세상은 예측 가능한 구조를 가져야만 한다
저는 이것이 지능을 이해하는
가장 중요한 출발점이라고 생각합니다.
어떤 지능이 존재하기 위한 첫 번째 조건은
세계가 ‘예측 가능한 구조’를 띠고 있어야 한다는 거예요.
만약 과거와 미래가 완전히 독립적인 우주를 상상해 보세요.
거기서는 인간의 뇌든,
거대한 AI 모델이든,
무한한 성능의 슈퍼컴퓨터든
과거를 관찰해 미래의 예측을 개선할 방법이 없습니다.
그 세계에는 더 이상 찾아내고 학습할
‘법칙’이 남아 있지 않을 테니까요.
아무런 패턴이 없는 백색 노이즈는
이해할 수도, 예측할 수도 없죠.
따라서 지능이 존재할 수 있다는 사실은
우주가 무작위성이 극대화된 혼돈 그 자체가 아님을 의미합니다.
오히려 우리 우주에는
다양한 규모를 가로지르며 안정적으로 유지되는
통계적 의존성,
기하학적 제약,
조합 구조,
동역학 법칙,
그리고 인과 관계가 존재한다는
가장 강력한 증거인 셈입니다.
학습이란 데이터 속에서 압축 법칙을 찾는 과정
이러한 관점에서 볼 때,
기계 학습이란 결국 방대한 데이터 속에서
‘압축 가능한 법칙’을 발굴하는 과정입니다.
아무리 AI가 사람 얼굴 사진 10억 장을 학습한다고 해도,
모델의 매개변수 안에 그 10억 장의 픽셀을
원본 그대로 욱여넣을 필요는 없죠.
모델이 진짜로 구축해야 하는 것은
인물의 정체성,
윤곽,
자세,
조명,
공간 관계 같은 잠재 변수들을 아우르는
‘생성 구조’입니다.
즉, 원본 훈련 데이터보다 물리적으로 훨씬 작은 모델을 통해
그 방대한 세상을 압축적으로 근사해 내는 거예요.
그래서 저는 학습이란
아주 깊은 의미에서 ‘압축’ 그 자체라고 봅니다.
어마어마한 크기의 데이터 집합을
훨씬 작고 효율적인 생성 프로그램으로 설명해 낼 수 있다면,
모델이 궁극적으로 얻어낸 것은
단순한 패턴이 아니라 보편적인 ‘법칙’이거든요.
이것은 정보 이론의
‘콜모고로프 복잡도(Kolmogorov Complexity)’가 제시하는 직관과도
정확히 일치합니다.
주어진 데이터를 설명하거나 생성하기 위해 필요한
가장 짧은 프로그램의 길이는 과연 얼마인가?
이것이야말로 지능과 학습을 이해하는
가장 매력적이고 중요한 질문일 것입니다.
지능의 전제조건은 “세계의 의존성”
그러나 데이터의 분포가 불균등하다는 사실 하나만으로
지능이 싹틀 수 있는 것은 아닙니다.
어떤 변수가 99%의 확률로 0이 되고,
단 1%의 확률로 1이 된다고 가정해 보죠.
이 분포는 극도로 불균등하긴 하지만,
그렇다고 해서 그 자체로 복잡하고 유의미한 구조를 가졌다고
말할 수는 없습니다.
여기서 진정으로 중요한 것은,
변수들 사이에 우리가 파악하고 활용할 수 있는
‘의존성’이 존재한다는 사실입니다.
“X라는 사실을 알게 되었을 때,
Y에 대한 불확실성을 줄일 수 있는가?”
바로 이 관계 속에 진짜 ‘정보’가 숨어 있습니다.
‘상호 정보량’이라는 수학적 개념이
본질적으로 측정하는 것도
다름 아닌 이 관계성이죠.
그러니 지능이란,
결국 이 세계 안에 아주 안정적이고 강력한 의존성이 존재한다는 사실에
온전히 기대고 있는 셈입니다.
우리가 마주하는
통계적 법칙,
기하학적 구조,
계층의 구조,
인과 관계,
그리고 시간적 연속성 등이
한데 어우러져 비로소
‘학습’이라는 경이로운 과정이 일어날 수 있는
견고한 기반을 완성하는 것입니다.
LLM에게 학습이란
저는 이것이 오늘날의 LLM을
가장 본질적이고 정확하게 이해하는 관점이라고 봅니다.
초기 상태의 신경망은
무작위로 설정되어 있습니다.
거대하긴 하지만 어떠한 의미도 띠지 않는
함수들의 무의미한 집합소에 불과하죠.
그런데 본격적인 훈련이 시작되면,
‘경사 하강법(Gradient Descent)’이
방대한 데이터를 지표 삼아
현실 세계의 법칙과 어긋나는 함수들을
끊임없이 걸러내고 배제합니다.
이러한 대규모 훈련을 거치고 나면,
무작위로 흩어져 있던 매개변수들이
점차 고도로 정제된 ‘내부 표현’을
스스로 형성하게 됩니다.
그 경이로운 구조 안에는
언어의 규칙과 공간적 관계는 물론,
인물과 개념 사이의 연결 고리,
프로그램의 논리 구조,
나아가 우리가 사는 세상의 물리 법칙의 일부까지
섬세하게 녹아들어 있습니다.
일반화와 추론 능력의 창발
AI는 자신이 연산하는 환경 안에서,
현실 세계가 가진 ‘안정적인 관계’의 일부를
온전히 보존할 수 있는 독자적인 내부 표현을
구축한다고 생각합니다.
즉, 복잡다단한 세계의 뼈대를
전혀 다른 질감의 캔버스 위에
고도로 압축하여 투영해 낸 셈입니다.
이런 관점에서 보면,
우리가 그토록 감탄하는 ‘지능의 창발’이라는 현상도
결코 설명할 수 없는 기적이 아닙니다.
그것은 구조의 깊이에 따라
자연스럽게 발현되는 결과입니다.
모델이 데이터 사이의
좁고 국지적인 통계적 상관관계만 포착할 때는
단순한 ‘패턴 매칭’으로 나타납니다.
그러나 더 멀리 떨어진 변수들의 관계를 담아내고
한층 추상적이며 안정적인 틀을 짤 수 있게 되면
‘일반화’가 일어납니다.
더 나아가,
이질적인 분야의 내부 구조를
자유롭게 넘나들며 재조합할 때
모델은 ‘유추와 연상’을 해내죠.
그리고 궁극적으로,
기존의 구조를 지렛대 삼아
훈련 데이터에 존재하지 않았던 낯선 상태마저
논리적으로 도출해 낼 때
비로소 ‘추론’이라는 차원의 능력이
꽃피우게 되는 것입니다.
AI에게 지능이 창발하는 순간
이런 맥락에서 볼 때,
저는 기억, 일반화, 유추, 그리고 추론에 이르는
지능의 여러 층위가
결국 ‘동일한 메커니즘’이
규모를 달리하여 발현된 것이라고 봅니다.
모델이 스스로 구축한
‘내부 세계 모델(World Model)’을 활용해,
아직 관측되지 않은 미지의 영역을
구조적으로 재구성해 내는
하나의 통일된 과정인 셈이죠.
여기서 모델의 ‘규모’가 왜 그토록 중요한지
그 이유가 분명해집니다.
이토록 복잡한 현실 세계를 온전히 투영해 내려면,
그만큼 방대하고 여유로운
‘함수 공간’이 확보되어야 하기 때문입니다.
특정한 지적 능력이 어느 순간 창발하는 현상 또한
다각도로 볼 필요가 있습니다.
때로는 그것이 평가 지표가 만들어낸
단순한 착시에 불과할 수도 있지만,
때로는 모델이 데이터의 근본 법칙을
단숨에 깨우치는 Grokking이나
내부 표현의 폭발적인 재조합처럼
실제적이고 극적인 비선형적 도약일 수도 있습니다.
따라서 우리가 진정으로 몰두해야 할 질문은
따로 있습니다.
바로 긴 학습의 궤적 속에서,
거대한 매개변수 공간 안에
도대체 어떤 ‘구조적 재조합’이 일어나길래
이토록 새로운 계산 능력이 탄생할 수 있는가 하는
본질적인 메커니즘의 규명입니다.
무엇을 남기고 무엇을 까먹을 것인가?
이 문제를 정보 이론과 통계 물리학의 차원으로까지 확장해 보면,
지능에 대한 한층 더 통합된 통찰을 얻을 수 있습니다.
저는 지능 시스템의 본질적인 역할을
다음과 같이 정의하고자 합니다.
당면한 과제와 무관한 노이즈(변화)는
끊임없이 깎아내고,
미래의 예측과 행동에 가치 있는
핵심 정보만을 정교하게 보존하는 것입니다.
이는 기계 학습의
‘Information Bottleneck’ 이론과
완벽하게 궤를 같이하는 관점입니다.
모델의 내부 표현은
입력된 데이터의 모든 세부 사항을
껴안을 필요가 없습니다.
그저 미래를 예측하고
적절한 행동을 유도할 수 있을 만큼의
구조적 뼈대만 유지하면 충분하기 때문입니다.
결국 방대한 정보의 홍수 속에서
‘무엇을 남기고
무엇을 기꺼이 망각할 것인가’를 아는 것.
그것이야말로 진정으로 고도화된 지능을 증명하는
가장 강력한 표식입니다.
지능의 본질
이러한 일련의 논의를 종합해 볼 때,
저는 지능의 본질을
‘압축(Compression)’,
‘예측(Prediction)’,
‘제어(Control)’라는
세 가지 축으로
명확히 설명할 수 있다고 봅니다.
‘압축’은
방대한 관측 데이터의 홍수 속에서
핵심적인 법칙만을 정제해 내는 과정입니다.
‘예측’은
그렇게 획득한 법칙을 나침반 삼아
아직 경험하지 못한 미지의 세계를 추론하는 행위이며,
‘제어’는
그 예측을 지렛대 삼아
기어이 미래의 궤적을 바꾸어 내는 실천입니다.
유한한 능력을 지닌 시스템이
자신보다 압도적으로 거대하고 복잡한 우주와 마주했을 때
취할 수 있는 최선의 전략은 무엇일까요?
세계를 끈질기게 관찰하고,
그 뼈대를 압축하여
정교한 내부 모델을 구축한 뒤,
오직 그 모델에 기대어
세계를 예측하고 주도적으로 개입하는 것입니다.
저는 이것이야말로
지능의 가장 보편적이면서도
궁극적인 형태라고 생각합니다.
표지로 돌아가기 ↑