주장: AI는 과학적 돌파구를 만들 수 있다.
증명: OpenAI의 내부 모델이 이산 기하학에서 가장 유명한 추측, 즉 단위 거리 문제에 대한 격자의 최적성(또는 그 부족)을 해결했습니다. 이 추측은 많은 관심에도 불구하고 80년 전 제기된 이후로 진전이 없었습니다. (그러나 그 주변에서는 많은 활동과 진전이 있었습니다!)
이 스레드에서 구체적으로 무슨 일이 일어났는지 설명하겠습니다. 다양한 수준의 복잡성으로 설명된 내용은 블로그 포스트, 세계 최고의 수학자들이 작성한 동반 논문 (오늘 늦게 arxiv에 게재 예정), 보고서 (원본 AI 증명 포함), 그리고 모델이 문제를 해결하는 과정을 담은 (재구성된) 사고 과정에서도 확인할 수 있습니다.
자, 그럼 우리가 무엇에 대해 이야기하고 있는지 살펴보겠습니다. 질문은 엄청나게 간단합니다. 평면에 n개의 점을 배치할 때, 그 점들 사이의 거리 중 같은 길이를 가질 수 있는 거리의 개수는 몇 개일까요? (축척을 조정하면 그중 몇 개가 1과 같은지 물어볼 수도 있으므로 '단위' 거리 문제라는 이름이 붙었습니다). 음, 한 점을 원의 중심에 놓고 다른 모든 점을 이 점을 중심으로 하는 원 위에 배치하면 n-1개의 거리가 같아집니다. 그리고 분명히 최대 n^2/2개의 거리가 존재합니다. 그렇다면 진실은 무엇일까요? 최선의 경우는 n 차수일까요, 아니면 n^2 차수일까요?
Erdos가 1946년에 이 문제를 소개했을 때, 그는 이 문제에 대한 가장 자연스러운 구성을 분석했습니다. 바로 점들을 단순한 격자에 배치하는 것입니다. 자, 이제 한 점은 이 격자 위에 4개의 이웃을 가지므로, 적어도 2n 차수의 거리가 같게 됩니다 (이중 계산 때문에 4n이 아닌 2n입니다). 하지만 조금 더 영리하게 생각해보면, 거리 1인 꼭짓점(격자가 단위 길이의 모서리를 갖는다고 가정) 대신 거리 sqrt(5) = sqrt(1+2^2)에 있는 꼭짓점을 살펴볼 수 있습니다. 그림을 조금만 그려보면 해당 거리에 8개의 점이 있다는 것을 알 수 있습니다! 실제로, 어떤 방향으로든 L자 모양을 따라 이동하면 됩니다 (그리고 그렇게 할 수 있는 방법은 8가지입니다). Erdos가 증명한 것은 (그리고 아래에서 증명을 제시하겠습니다) 이와 같은 방식으로 2의 거듭제곱으로, 약 u(n) = 2^{log(n)/loglog(n)}까지 계속 나아갈 수 있다는 것입니다. 즉, 격자는 적어도 약 u(n)n개의 같은 거리를 가지며, 실제로 이 계산은 격자에 대해 최적입니다. u(n)*n = n^{1+o(1)} (구체적으로는 n^{1+cst/loglog(n)})입니다.
Erdos가 추측한 것은 격자가 본질적으로 최적이라는 것입니다. 즉, 어떤 점 배열이든 최대 n^{1+o(1)}개의 같은 거리를 가져야 한다는 것입니다. 이것이 지난 80년 동안 진전이 없었던 문제이며, 이 질문이 얼마나 기본적이고 자연스러운지에 대한 많은 관심에도 불구하고 다시 한 번 진전이 없었습니다. 제가 이해하기로 Erdos는 격자가 최적이라고 강하게 믿었으며, 실제로 밀접하게 관련된 문제(1946년 같은 논문에서 소개된!)인 서로 다른 거리 문제에서는 그의 생각이 옳았던 것으로 드러났습니다. 서로 다른 거리 문제는 단순히 이 질문의 반대 버전으로, n개의 점이 만들 수 있는 서로 다른 거리의 최소 개수는 무엇인지 묻습니다. 격자는 n/sqrt(log(n))개의 서로 다른 거리를 제공하며, 10년 전 Guth와 Katz의 획기적인 논문은 n/log(n)의 하한을 통해 이것이 실제로 본질적으로 최적임을 보여주었습니다. 즉, 모든 것이 격자가 단위 거리 문제에 대한 최적의 후보임을 가리키고 있었습니다.
여기에 OpenAI 내부 모델이 등장합니다. 이 모델은 실제로 오랫동안 유지되어 온 이 믿음을 강력하게 반박했으며, 어떤 delta>0에 대해 n^{1+delta} 차수의 같은 거리 개수를 갖는 새로운 (경이로운) 구성을 발견했습니다. 이 돌파구가 모델에 의해 어떻게 달성되었는지에 대해 몇 마디 말하려면 먼저 Erdos의 증명과 2^{log(n)/loglog(n)}이 어디서 나오는지에 대해 조금 더 알려드려야 합니다. 알고 보니 소수들이 숨어 있습니다!
우리는 소수에 대해 두 가지를 가정할 것입니다. 첫째, n 이하의 소수가 약 n/log(n)개 있다는 소수 정리입니다 (사실 약간 더 정교한 버전이 필요하지만 이 설명 수준에서는 중요하지 않습니다). 둘째, 소수가 1 modulo 4와 같다면, 그것은 가우시안 정수 (a+ib 형태의 정수, 여기서 a와 b는 정수)로 인수분해된다는 것입니다. 즉, 이 경우 p = z bar{z}입니다. 예를 들어 5=(1+2i)(1-2i)이며, 이것은 위에서 거리 sqrt(5) = sqrt(1+2^2)에 있는 8개의 꼭짓점을 셀 때를 떠올리게 할 것입니다. 자, 이제 1 modulo 4와 같은 처음 k개의 소수 p_1, …, p_k를 취하고 숫자 R=p_1…p_k = z_1 bar{z_1} … z_k \bar{z_k}를 고려해보세요. 핵심은 각 소수 p_i에 대해 z_i 또는 bar{z_i}를 취한 다음 그 곱을 취함으로써 sqrt{R}과 같은 계수를 가진 2^k개의 가우시안 정수를 얻는다는 것입니다 (중요한 것은 계수가 곱셈적이고 켤레가 계수를 보존한다는 점을 사용한다는 것입니다). 즉, 우리는 격자 상의 원점으로부터 sqrt{R} 거리에 있는 2^k개의 점을 발견한 것입니다! (정확히 말하면, 이 점들이 서로 다르다는 것도 증명해야 하는데, 여기서 Z[i]의 유일한 인수분해가 중요해지며, 이것은 새로운 증명에서도 핵심이 될 것이지만, 여기서는 무시하겠습니다.) 이제 우리는 sqrt{R}<sqrt{n} (후자는 n개의 점을 가진 격자의 한 변의 길이)를 유지하면서 k를 얼마나 크게 잡을 수 있는지 알아보기만 하면 됩니다. log(R) = sum_{i=1}^k log(p_i)이며, 이는 소수 정리에 의해 대략 sum_{i=1}^k log(i log(i))이며, 이는 기본적으로 k log(k)입니다. 따라서 k log(k)가 log(n)보다 작아야 하므로, k는 log(n)/loglog(n)과 같아야 하며, 우리는 주장된 2^k = 2^{log(n)/loglog(n)}을 얻습니다.
위의 한 문단으로 설명된 주장 (인정하건대 영리한 주장입니다)은 80년 동안 최신 기술(SOTA)로 남아 있었습니다. 이제 AI가 한 일은 제 생각에 꽤 놀랍습니다. 첫째, CoT에서 볼 수 있듯이, AI는 거의 즉시 격자 구성을 개선하려고 시도했는데, 이는 지금까지 대부분의 수학자들이 시도해왔던 것과는 반대입니다. 제 제한된 이해로는, AI가 도달한 (그리고 완벽하게 실행한) 전략은 대략 다음과 같습니다. 소수를 분할하는 더 많은 방법이 있다면 좋지 않을까? 아마도 Q가 아닌 다른 체, 더 높은 차수의 체를 고려한다면, 정수 Z를 그 체의 정수환으로 대체하여 작동할 수 있을까? 아마도 2^k 대신 2^{f k}를 얻을 수 있을까? 여기서 f는 체의 차수이다? 첫 번째 추측은 원분 확장을 살펴보는 것이지만, 모델은 CoT에서 먼저 그것을 시도하고 이것이 작동하지 않을 것임을 빠르게 깨닫습니다. 모델은 계속 열심히 작업하고 결국 아이디얼의 언어를 도입하는데, 여기서는 유일하지 않은 인수분해가 가능하며 클래스 군에 의해 처리됩니다. 이제 모든 매개변수를 제어하면서 고차원 체를 어떻게 구성할지 생각하기 시작해야 합니다 (먼저 클래스 수, 또한 이것은 고차원 격자가 될 것이므로 복소 평면으로 다시 투영되어야 하며, 이 투영은 제어해야 할 약간의 축소를 유발할 것이고, 계속해서 계속됩니다). 여기서 모델은 클래스 체론의 강력한 도구, 즉 Golod-Shafarevich의 무한 탑을 사용합니다. 이 시점에서는 자세한 내용을 위해 실제 전문가들이 작성한 동반 논문을 살펴보는 것이 더 나을 것입니다!
자, 잠시 뒤로 물러서겠습니다. 기본적으로 AI가 한 것은 수학 전체에 대한 방대한 지식을 사용하여 이산 기하학과 대수적 정수론 사이의 연관성을 발견하고, 결정적으로 각 단계에서 전문가 수준의 계산을 통해 그 논증을 능숙하게 연결할 수 있었다는 것입니다. 이것은 진정한 획기적인 결과이지만, 동시에 모델이 어떤 '새로운 수학'을 '발명'하지 않았다는 것도 사실입니다 (예를 들어, 어떤 대안적인 클래스 체론을 발명하지 않았습니다, 그것이 무엇을 의미하든). 그러나 이것이 중요한 점입니다. 단순히 과학 분야의 모든 결과를 깊이 알고, 알려진 모든 논증을 전문적으로 그리고 정확한 매개변수 선택과 함께 사용할 수 있는 것만으로도 수많은 돌파구를 이끌어낼 수 있으며, 이것은 수학에만 국한되지 않고, 이러한 유형의 (극도로) 견고한 전문가 실행은 많은 과학적 발전의 핵심입니다.
마지막으로 이것이 앞으로 수학에 대해 의미하는 바에 대해 한마디 하겠습니다. 동반 논문에는 이에 대한 주요 수학자들의 많은 고찰이 담겨 있으므로, 그들이 무엇을 말하는지 직접 읽어보는 것이 좋습니다. 그러나 한 가지 흥미로운 점은 우리가 모델의 증명을 arxiv에 제출하지 않는다는 것입니다. 실제로 전통적인 의미에서 기여했다고 주장할 수 있는 인간 저자는 없습니다 (물론 이 놀라운 모델을 만든 OpenAI의 모든 인간 연구자들, 그리고 수천 년 동안 수학을 발전시켜 온 인류 전체의 결실이기는 하지만요). 다른 한편으로, 인간에 의한 동반 논문은 이 순간의 중요성에 대한 고찰을 넘어서, 증명을 소화하고, 더 넓은 맥락에 배치하며, 심지어 약간 단순화하기도 합니다. 커뮤니티가 이러한 새로운 발전에 완전히 적응하기 위해 여전히 해야 할 일이 많지만, 우리는 AI 증명과 인간의 이해를 분리하는 이 원칙이 퍼즐의 중요한 조각이 될 것이라고 믿습니다.





