D DVERSE ZIP
18

COMPRESSION · PREDICTION · CONTROL

지능의 본질은
압축이다

The essence of intelligence.

원문 · romaan.mag

첫 장부터 읽기
목차 펼치기
CHAPTER 01

매니폴드 가설: 중요한 데이터는 기하학적으로 모여있다

낮은 차원의 구조고차원 공간에 흩어진 모든 가능성과, 휘어진 하나의 면 주변에 모인 현실 데이터.가능한 데이터의 공간현실의 데이터복잡한 공간 안의, 더 작은 구조
FIG. 01현실의 데이터는 가능한 모든 조합을 채우지 않고, 제약을 따르는 작은 구조 주변에 모인다.

AI와 정보 이론을 관통하는 직관 중에
‘매니폴드 가설’이라는 것이 있습니다.

현실 세계의 데이터는
참 놀라울 정도로 복잡하고 차원이 높죠.

고해상도 이미지 한 장이 품고 있는 수백만 개의 픽셀,
혹은 우리가 쓰는 언어나 행동 궤적만 보아도
상상하기 힘들 만큼 거대한 공간을 차지하고 있으니까요.

하지만 유의미한 데이터는
그 광활한 공간에 균등하게 퍼져 있지 않습니다.

오히려 아주 특수한 구조를 띤 좁은 영역에
압축되어 존재합니다.

무작위로 만들어낸 백만 개의 픽셀이
우연히 사람의 얼굴을 형상화할 리는 없겠죠.

우리가 보는 현실의 이미지는
원근법, 조명, 객체의 구조, 심지어 물리 법칙까지
수많은 제약 조건들이 겹겹이 쌓여 만들어진 결과물이기 때문입니다.

이처럼 고차원의 데이터 속에 웅크리고 있는
‘낮은 복잡도의 구조’를
기하학적으로 그려낸 것이 바로 매니폴드입니다.

AI가 이토록 성공적인 이유를 한마디로 요약하자면,

현실의 데이터가 무의미한 노이즈의 덩어리가 아니라
분명한 규칙과 궤적을 가지고 있다는 사실,
바로 그 지점에 있습니다.

CHAPTER 02

세상은 예측 가능한 구조를 가져야만 한다

예측을 가능하게 하는 규칙규칙적인 관측에서는 흐름이 미래로 이어지지만, 독립적인 관측에서는 다음 흐름이 정해지지 않는다.규칙이 있는 세계독립적인 세계지금까지의 관측이후의 가능성
FIG. 02과거의 관측이 미래에 유용하려면, 시간 너머로 이어지는 규칙과 관계가 필요하다.

저는 이것이 지능을 이해하는
가장 중요한 출발점이라고 생각합니다.

어떤 지능이 존재하기 위한 첫 번째 조건은
세계가 ‘예측 가능한 구조’를 띠고 있어야 한다는 거예요.

만약 과거와 미래가 완전히 독립적인 우주를 상상해 보세요.

거기서는 인간의 뇌든,
거대한 AI 모델이든,
무한한 성능의 슈퍼컴퓨터든

과거를 관찰해 미래의 예측을 개선할 방법이 없습니다.

그 세계에는 더 이상 찾아내고 학습할
‘법칙’이 남아 있지 않을 테니까요.

아무런 패턴이 없는 백색 노이즈는
이해할 수도, 예측할 수도 없죠.

따라서 지능이 존재할 수 있다는 사실은
우주가 무작위성이 극대화된 혼돈 그 자체가 아님을 의미합니다.

오히려 우리 우주에는
다양한 규모를 가로지르며 안정적으로 유지되는

통계적 의존성,
기하학적 제약,
조합 구조,
동역학 법칙,
그리고 인과 관계가 존재한다는

가장 강력한 증거인 셈입니다.

CHAPTER 03

학습이란 데이터 속에서 압축 법칙을 찾는 과정

많은 사례에서 작은 법칙으로다수의 관측 데이터가 작은 함수 f(z)로 모이고, 그 함수에서 서로 다른 사례가 구성된다.f(z)방대한 관측작은 생성 법칙다양한 구성
FIG. 03학습은 모든 사례를 그대로 저장하는 대신, 사례들을 설명할 수 있는 생성 구조를 찾는다.

이러한 관점에서 볼 때,
기계 학습이란 결국 방대한 데이터 속에서
‘압축 가능한 법칙’을 발굴하는 과정입니다.

아무리 AI가 사람 얼굴 사진 10억 장을 학습한다고 해도,
모델의 매개변수 안에 그 10억 장의 픽셀을
원본 그대로 욱여넣을 필요는 없죠.

모델이 진짜로 구축해야 하는 것은

인물의 정체성,
윤곽,
자세,
조명,
공간 관계 같은 잠재 변수들을 아우르는
‘생성 구조’입니다.

즉, 원본 훈련 데이터보다 물리적으로 훨씬 작은 모델을 통해
그 방대한 세상을 압축적으로 근사해 내는 거예요.

그래서 저는 학습이란
아주 깊은 의미에서 ‘압축’ 그 자체라고 봅니다.

어마어마한 크기의 데이터 집합을
훨씬 작고 효율적인 생성 프로그램으로 설명해 낼 수 있다면,

모델이 궁극적으로 얻어낸 것은
단순한 패턴이 아니라 보편적인 ‘법칙’이거든요.

이것은 정보 이론의
‘콜모고로프 복잡도(Kolmogorov Complexity)’가 제시하는 직관과도
정확히 일치합니다.

주어진 데이터를 설명하거나 생성하기 위해 필요한
가장 짧은 프로그램의 길이는 과연 얼마인가?

이것이야말로 지능과 학습을 이해하는
가장 매력적이고 중요한 질문일 것입니다.

CHAPTER 04

지능의 전제조건은 “세계의 의존성”

관계가 정보가 되는 순간넓게 퍼져 있던 Y의 가능한 값들이 X를 관측한 뒤 더 좁은 범위에 모이는 개념도.Y만 볼 때X를 함께 알 때관측 X넓은 불확실성줄어든 불확실성
FIG. 04X에 대한 정보가 Y의 불확실성을 줄인다면, 두 변수 사이의 관계를 활용할 수 있다. 분포는 설명을 위한 개념도다.

그러나 데이터의 분포가 불균등하다는 사실 하나만으로
지능이 싹틀 수 있는 것은 아닙니다.

어떤 변수가 99%의 확률로 0이 되고,
단 1%의 확률로 1이 된다고 가정해 보죠.

이 분포는 극도로 불균등하긴 하지만,
그렇다고 해서 그 자체로 복잡하고 유의미한 구조를 가졌다고
말할 수는 없습니다.

여기서 진정으로 중요한 것은,

변수들 사이에 우리가 파악하고 활용할 수 있는
‘의존성’이 존재한다는 사실입니다.

“X라는 사실을 알게 되었을 때,
Y에 대한 불확실성을 줄일 수 있는가?”

바로 이 관계 속에 진짜 ‘정보’가 숨어 있습니다.

‘상호 정보량’이라는 수학적 개념이
본질적으로 측정하는 것도
다름 아닌 이 관계성이죠.

그러니 지능이란,
결국 이 세계 안에 아주 안정적이고 강력한 의존성이 존재한다는 사실에
온전히 기대고 있는 셈입니다.

우리가 마주하는

통계적 법칙,
기하학적 구조,
계층의 구조,
인과 관계,
그리고 시간적 연속성 등이

한데 어우러져 비로소
‘학습’이라는 경이로운 과정이 일어날 수 있는
견고한 기반을 완성하는 것입니다.

CHAPTER 05

LLM에게 학습이란

학습은 반복되는 갱신매개변수에 따른 오차 곡면을 한 단면으로 표현하고, 초기값에서 오차가 낮은 방향으로 여러 번 이동하는 경사 하강 과정을 표시했다.오차매개변수초기값오차를 줄이는 갱신
FIG. 05경사 하강은 오차를 줄이는 방향으로 매개변수를 반복 갱신한다. 실제 학습은 훨씬 많은 차원에서 일어난다.

저는 이것이 오늘날의 LLM을
가장 본질적이고 정확하게 이해하는 관점이라고 봅니다.

초기 상태의 신경망은
무작위로 설정되어 있습니다.

거대하긴 하지만 어떠한 의미도 띠지 않는
함수들의 무의미한 집합소에 불과하죠.

그런데 본격적인 훈련이 시작되면,

‘경사 하강법(Gradient Descent)’이
방대한 데이터를 지표 삼아

현실 세계의 법칙과 어긋나는 함수들을
끊임없이 걸러내고 배제합니다.

이러한 대규모 훈련을 거치고 나면,

무작위로 흩어져 있던 매개변수들이
점차 고도로 정제된 ‘내부 표현’을
스스로 형성하게 됩니다.

그 경이로운 구조 안에는

언어의 규칙과 공간적 관계는 물론,
인물과 개념 사이의 연결 고리,
프로그램의 논리 구조,

나아가 우리가 사는 세상의 물리 법칙의 일부까지
섬세하게 녹아들어 있습니다.

CHAPTER 06

일반화와 추론 능력의 창발

관계가 넓어질 때비슷한 패턴의 반복, 공통 구조, 다른 형태 사이의 연결, 아직 보지 않은 사례의 추론을 네 개의 도형으로 표현했다.?패턴 매칭일반화유추추론
FIG. 06원문은 국소적인 패턴에서 공통 구조로, 구조의 재조합에서 미지의 추론으로 논의를 확장한다.

AI는 자신이 연산하는 환경 안에서,

현실 세계가 가진 ‘안정적인 관계’의 일부를
온전히 보존할 수 있는 독자적인 내부 표현을
구축한다고 생각합니다.

즉, 복잡다단한 세계의 뼈대를
전혀 다른 질감의 캔버스 위에
고도로 압축하여 투영해 낸 셈입니다.

이런 관점에서 보면,
우리가 그토록 감탄하는 ‘지능의 창발’이라는 현상도
결코 설명할 수 없는 기적이 아닙니다.

그것은 구조의 깊이에 따라
자연스럽게 발현되는 결과입니다.

모델이 데이터 사이의
좁고 국지적인 통계적 상관관계만 포착할 때는
단순한 ‘패턴 매칭’으로 나타납니다.

그러나 더 멀리 떨어진 변수들의 관계를 담아내고
한층 추상적이며 안정적인 틀을 짤 수 있게 되면
‘일반화’가 일어납니다.

더 나아가,
이질적인 분야의 내부 구조를
자유롭게 넘나들며 재조합할 때

모델은 ‘유추와 연상’을 해내죠.

그리고 궁극적으로,

기존의 구조를 지렛대 삼아
훈련 데이터에 존재하지 않았던 낯선 상태마저
논리적으로 도출해 낼 때

비로소 ‘추론’이라는 차원의 능력이
꽃피우게 되는 것입니다.

CHAPTER 07

AI에게 지능이 창발하는 순간

학습과 일반화의 서로 다른 시간훈련 사례의 성능은 일찍 높아지고 새로운 사례의 성능은 더 긴 학습 이후 높아지는 그로킹의 개념도.성능학습 진행훈련 사례새로운 사례뒤늦은 일반화
FIG. 07훈련 사례를 잘 맞히는 시점과 새 사례로 일반화하는 시점은 다를 수 있다. 실제 측정값이 아닌 그로킹 개념도다.

이런 맥락에서 볼 때,

저는 기억, 일반화, 유추, 그리고 추론에 이르는
지능의 여러 층위가

결국 ‘동일한 메커니즘’이
규모를 달리하여 발현된 것이라고 봅니다.

모델이 스스로 구축한
‘내부 세계 모델(World Model)’을 활용해,

아직 관측되지 않은 미지의 영역을
구조적으로 재구성해 내는
하나의 통일된 과정인 셈이죠.

여기서 모델의 ‘규모’가 왜 그토록 중요한지
그 이유가 분명해집니다.

이토록 복잡한 현실 세계를 온전히 투영해 내려면,

그만큼 방대하고 여유로운
‘함수 공간’이 확보되어야 하기 때문입니다.

특정한 지적 능력이 어느 순간 창발하는 현상 또한
다각도로 볼 필요가 있습니다.

때로는 그것이 평가 지표가 만들어낸
단순한 착시에 불과할 수도 있지만,

때로는 모델이 데이터의 근본 법칙을
단숨에 깨우치는 Grokking이나

내부 표현의 폭발적인 재조합처럼
실제적이고 극적인 비선형적 도약일 수도 있습니다.

따라서 우리가 진정으로 몰두해야 할 질문은
따로 있습니다.

바로 긴 학습의 궤적 속에서,

거대한 매개변수 공간 안에
도대체 어떤 ‘구조적 재조합’이 일어나길래

이토록 새로운 계산 능력이 탄생할 수 있는가 하는
본질적인 메커니즘의 규명입니다.

CHAPTER 08

무엇을 남기고 무엇을 까먹을 것인가?

무엇을 남기고 무엇을 잊을까입력의 여러 선 중 과제에 유용한 관계는 좁은 내부 표현을 통과하여 예측으로 연결되고 무관한 세부는 아래로 빠져나간다.입력 X표현 Z예측 Y남길 관계덜어낼 세부
FIG. 08모든 세부를 보존하기보다, 과제의 예측에 유용한 관계를 내부 표현에 남긴다.

이 문제를 정보 이론과 통계 물리학의 차원으로까지 확장해 보면,
지능에 대한 한층 더 통합된 통찰을 얻을 수 있습니다.

저는 지능 시스템의 본질적인 역할을
다음과 같이 정의하고자 합니다.

당면한 과제와 무관한 노이즈(변화)는
끊임없이 깎아내고,

미래의 예측과 행동에 가치 있는
핵심 정보만을 정교하게 보존하는 것입니다.

이는 기계 학습의
‘Information Bottleneck’ 이론과
완벽하게 궤를 같이하는 관점입니다.

모델의 내부 표현은
입력된 데이터의 모든 세부 사항을
껴안을 필요가 없습니다.

그저 미래를 예측하고
적절한 행동을 유도할 수 있을 만큼의
구조적 뼈대만 유지하면 충분하기 때문입니다.

결국 방대한 정보의 홍수 속에서

‘무엇을 남기고
무엇을 기꺼이 망각할 것인가’를 아는 것.

그것이야말로 진정으로 고도화된 지능을 증명하는
가장 강력한 표식입니다.

CHAPTER 09

지능의 본질

압축, 예측, 제어의 순환세계의 관측에서 압축으로, 내부 모델을 이용한 예측으로, 제어와 행동을 거쳐 다시 세계로 되돌아가는 피드백 순환.세계압축예측제어내부 모델관측행동
FIG. 09관측으로 세계의 구조를 배우고, 예측을 바탕으로 행동하며, 그 결과를 다시 관측한다.

이러한 일련의 논의를 종합해 볼 때,

저는 지능의 본질을

‘압축(Compression)’,
‘예측(Prediction)’,
‘제어(Control)’라는

세 가지 축으로
명확히 설명할 수 있다고 봅니다.

‘압축’은
방대한 관측 데이터의 홍수 속에서
핵심적인 법칙만을 정제해 내는 과정입니다.

‘예측’은
그렇게 획득한 법칙을 나침반 삼아
아직 경험하지 못한 미지의 세계를 추론하는 행위이며,

‘제어’는
그 예측을 지렛대 삼아
기어이 미래의 궤적을 바꾸어 내는 실천입니다.

유한한 능력을 지닌 시스템이
자신보다 압도적으로 거대하고 복잡한 우주와 마주했을 때
취할 수 있는 최선의 전략은 무엇일까요?

세계를 끈질기게 관찰하고,

그 뼈대를 압축하여
정교한 내부 모델을 구축한 뒤,

오직 그 모델에 기대어
세계를 예측하고 주도적으로 개입하는 것입니다.

저는 이것이야말로
지능의 가장 보편적이면서도
궁극적인 형태라고 생각합니다.

지능의 본질은 압축이다
표지로 돌아가기 ↑