Tuyên bố: AI có thể tạo ra những đột phá khoa học.
Bằng chứng: Một mô hình nội bộ của OpenAI đã giải quyết phỏng đoán nổi tiếng nhất trong hình học rời rạc, cụ thể là tính tối ưu (hoặc không) của lưới đối với bài toán khoảng cách đơn vị. Phỏng đoán này đã không có tiến triển nào, mặc dù có rất nhiều sự quan tâm, kể từ khi ra đời 80 năm trước. (Tuy nhiên, đã có rất nhiều hoạt động và tiến triển xung quanh nó!)
Hãy để tôi dùng bài viết này để giải thích cụ thể những gì đã xảy ra. Bạn cũng có thể tìm thấy các giải thích ở nhiều mức độ phức tạp khác nhau trong bài đăng trên blog của chúng tôi, trong bài báo đồng hành được viết bởi các nhà toán học hàng đầu thế giới (sẽ xuất hiện trên arxiv vào cuối ngày hôm nay), trong báo cáo với chứng minh AI gốc, và trong chuỗi suy luận (đã được viết lại) của mô hình khi giải quyết vấn đề.
Được rồi, vậy chúng ta đang nói về điều gì: câu hỏi cực kỳ đơn giản; nếu tôi đặt n điểm trong mặt phẳng thì có bao nhiêu khoảng cách giữa các điểm đó có thể bằng nhau? (Bằng cách thay đổi tỷ lệ, bạn cũng có thể đặt câu hỏi có bao nhiêu khoảng cách trong số đó có thể bằng 1, do đó có tên là bài toán khoảng cách "đơn vị"). Chắc chắn, bạn có thể đặt một điểm ở tâm của một hình tròn và tất cả các điểm còn lại trên một đường tròn có tâm tại điểm này, điều này sẽ dẫn đến n-1 khoảng cách bằng nhau. Và hiển nhiên có tối đa n^2/2 khoảng cách. Vậy sự thật là gì, kết quả tốt nhất có thể đạt được là theo bậc n hay theo bậc n^2?
Khi Erdos giới thiệu bài toán vào năm 1946, ông đã phân tích cấu trúc tự nhiên nhất cho bài toán này: đặt các điểm trên một lưới đơn giản. Được rồi, một điểm bây giờ có 4 lân cận trên lưới này, vì vậy chắc chắn có ít nhất khoảng 2
khoảng cách bằng nhau (2n chứ không phải 4n vì tính trùng lặp). Nhưng hãy thông minh hơn một chút, thay vì nhìn vào các đỉnh cách nhau 1 đơn vị (giả sử lưới có cạnh dài đơn vị), chúng ta có thể nhìn vào các đỉnh cách nhau sqrt(5) = sqrt(1+2^2). Chỉ cần vẽ một hình nhỏ và bạn sẽ thấy có 8 điểm ở khoảng cách đó! Thực tế, bạn về cơ bản di chuyển theo hình chữ L theo bất kỳ hướng nào (và có 8 cách để làm điều đó). Điều Erdos đã chứng minh (và tôi sẽ đưa ra chứng minh dưới đây) là bạn có thể tiếp tục như vậy theo lũy thừa của 2, lên đến khoảng u(n) = 2^{log(n)/loglog(n)}. Điều này có nghĩa là lưới có ít nhất khoảng u(n)
khoảng cách bằng nhau, và trên thực tế, phép tính này là tối ưu cho lưới. Lưu ý rằng u(n)*n = n^{1+o(1)} (cụ thể là n^{1+cst/loglog(n)}).
Điều Erdos đã phỏng đoán là lưới về cơ bản là tối ưu: bất kỳ cấu hình điểm nào cũng có tối đa n^{1+o(1)} khoảng cách bằng nhau. Đây là vấn đề đã không có tiến triển nào trong 80 năm qua, một lần nữa mặc dù có rất nhiều sự quan tâm vì câu hỏi này cơ bản và tự nhiên đến mức nào. Theo hiểu biết của tôi, Erdos tin tưởng mạnh mẽ rằng lưới là tối ưu, và trên thực tế, trong bài toán có liên quan chặt chẽ (được giới thiệu trong cùng một bài báo năm 1946!) về các khoảng cách phân biệt, ông đã được chứng minh là đúng. Bài toán khoảng cách phân biệt đơn giản là phiên bản ngược lại của câu hỏi, trong đó người ta hỏi số lượng tối thiểu các khoảng cách phân biệt mà n điểm có thể tạo thành là bao nhiêu? Lưới cho bạn n/sqrt(log(n)) khoảng cách phân biệt, và một bài báo đột phá của Guth và Katz 10 năm trước đã chỉ ra rằng điều này thực sự là tối ưu về cơ bản với cận dưới là n/log(n). Nói cách khác: mọi thứ đều chỉ ra rằng lưới cũng là một ứng cử viên tối ưu cho bài toán khoảng cách đơn vị.
Đây là lúc mô hình nội bộ của OpenAI xuất hiện. Nó thực sự đã BÁC BỎ mạnh mẽ niềm tin lâu đời này và tìm ra một cấu trúc mới (gây chấn động) với số lượng khoảng cách bằng nhau theo bậc n^{1+delta} với delta>0 nào đó. Để nói vài lời về cách mô hình đạt được đột phá này, trước tiên tôi cần kể cho bạn thêm một chút về chứng minh của Erdos và nơi 2^{log(n)/loglog(n)} đến từ đâu. Hóa ra các số nguyên tố ẩn nấp xung quanh!
Chúng ta sẽ giả định hai điều về số nguyên tố: thứ nhất là định lý số nguyên tố nói rằng có khoảng n/log(n) số nguyên tố dưới n (thực ra chúng ta cần một phiên bản tinh tế hơn một chút nhưng điều đó không quan trọng đối với mức độ trình bày này). Thứ hai, nếu một số nguyên tố bằng 1 modulo 4, thì nó phân tích thành nhân tử trên các số nguyên Gauss (là các số nguyên có dạng a+ib với a và b là số nguyên), cụ thể trong trường hợp này p = z bar{z}. Ví dụ 5=(1+2i)(1-2i), và điều này sẽ nhắc bạn nhớ ở trên khi chúng ta đếm 8 đỉnh ở khoảng cách sqrt(5) = sqrt(1+2^2). Được rồi, bây giờ hãy lấy k số nguyên tố đầu tiên bằng 1 modulo 4, p_1, …, p_k, và xét số R=p_1…p_k = z_1 bar{z_1} … z_k \bar{z_k}. Điểm mấu chốt là chúng ta có được 2^k số nguyên Gauss từ điều này với mô-đun bằng sqrt{R}, bằng cách chọn với mỗi số nguyên tố p_i lấy z_i hoặc bar{z_i} và sau đó lấy tích của chúng (quan trọng là chúng ta sử dụng tính chất mô-đun là nhân tính và phép liên hợp bảo toàn mô-đun). Nói cách khác, chúng ta đã tìm thấy 2^k điểm ở khoảng cách sqrt{R} từ gốc tọa độ trên lưới! (Để chính xác, chúng ta cũng phải chứng minh rằng các điểm này là phân biệt, đó là nơi mà tính duy nhất phân tích thành nhân tử trong Z[i] trở nên quan trọng, và điều gì đó sẽ là chìa khóa trong chứng minh mới, nhưng hãy bỏ qua điều đó ở đây.) Vì vậy, bây giờ chúng ta chỉ cần xem k có thể lớn đến mức nào trong khi vẫn giữ sqrt{R}<sqrt{n} (cái sau là độ dài cạnh của lưới với n điểm). Chúng ta có log(R) = sum_{i=1}^k log(p_i) mà theo định lý số nguyên tố thì xấp xỉ sum_{i=1}^k log(ilog(i)) về cơ bản là klog(k). Vì vậy, chúng ta cần klog(k) nhỏ hơn log(n), do đó k nên là log(n)/loglog(n), và chúng ta có được 2^k = 2^{log(n)/loglog(n)} như đã tuyên bố.
Lập luận một đoạn trên đây (một lập luận thông minh, tôi công nhận điều đó) đã là SOTA trong 80 năm. Bây giờ, theo tôi, những gì AI đã làm là khá điên rồ. Trước hết, như có thể thấy trong CoT, nó gần như ngay lập tức quyết định cố gắng cải thiện cấu trúc lưới, điều ngược lại với những gì hầu hết các nhà toán học đã cố gắng làm cho đến nay. Theo hiểu biết hạn chế của tôi, chiến lược mà nó đưa ra (và đã thực hiện một cách hoàn hảo) đại khái là như thế này: sẽ tuyệt vời biết bao nếu có nhiều cách hơn để phân tách các số nguyên tố? Có lẽ nếu chúng ta xem xét một trường khác Q, một trường có bậc cao hơn, thì điều này có thể hoạt động với các số nguyên Z được thay thế bằng vành các số nguyên của trường đó? Có lẽ thay vì 2^k, chúng ta có thể có 2^{f k} trong đó f là bậc của trường? Dự đoán đầu tiên sẽ là xem xét các mở rộng cyclotomic nhưng mô hình làm điều đó đầu tiên trong CoT của nó và nhanh chóng nhận ra rằng điều này sẽ không hiệu quả. Nó tiếp tục làm việc chăm chỉ và cuối cùng đưa ra ngôn ngữ của các ideal, nơi có thể có sự phân tích thành nhân tử không duy nhất được xử lý bởi một nhóm lớp. Bây giờ bạn cần bắt đầu suy nghĩ về cách bạn sẽ xây dựng các trường bậc cao với tất cả các tham số được kiểm soát (đầu tiên là số lớp, nhưng điều này cũng sẽ là một mạng tinh thể có chiều cao hơn, vì vậy nó sẽ cần được chiếu trở lại mặt phẳng phức, và phép chiếu này sẽ gây ra một số sự thu gọn cần được kiểm soát, và cứ thế). Đó là nơi mô hình sử dụng một công cụ mạnh từ lý thuyết trường lớp, các tháp vô hạn từ Golod-Shafarevich. Tại thời điểm này, tốt hơn hết bạn nên đến với bài báo đồng hành của các chuyên gia thực tế về chủ đề này để biết thêm chi tiết!
Được rồi, hãy lùi lại một bước: về cơ bản, những gì AI đã làm là nó có thể sử dụng kiến thức sâu rộng của mình về toàn bộ toán học, để thấy một mối liên hệ giữa hình học rời rạc và lý thuyết số đại số, và sau đó, quan trọng là nó có thể kết nối các lập luận một cách điêu luyện, với các tính toán ở cấp độ chuyên gia ở mọi bước. Đó thực sự là một kết quả đột phá, nhưng đồng thời cũng đúng rằng mô hình không "phát minh" ra bất kỳ "toán học mới" nào (ví dụ, nó không phát minh ra một lý thuyết trường lớp thay thế nào đó, bất kể điều đó có nghĩa là gì). Nhưng đây là điểm mấu chốt: chỉ cần có khả năng hiểu sâu sắc tất cả các kết quả trong một lĩnh vực khoa học, và có thể sử dụng tất cả các lập luận đã biết một cách chuyên nghiệp và với sự lựa chọn tham số phù hợp, một mình điều đó có thể dẫn đến vô số đột phá, và điều này không chỉ giới hạn trong toán học, loại thực thi chuyên gia (cực kỳ) vững chắc này chính là cốt lõi của rất nhiều tiến bộ khoa học.
Cuối cùng, một lời về ý nghĩa của điều này đối với toán học trong tương lai. Bài báo đồng hành có rất nhiều suy ngẫm về điều đó từ các nhà toán học hàng đầu, vì vậy tốt hơn hết là đọc những gì HỌ nói. Nhưng có một điều thú vị cần lưu ý là chúng tôi KHÔNG gửi chứng minh của mô hình lên arxiv. Thực tế, không có tác giả con người nào có thể tuyên bố đã đóng góp theo nghĩa truyền thống (mặc dù tất nhiên nó thực sự là thành quả của tất cả các nhà nghiên cứu con người tại OpenAI, những người đã tạo ra mô hình tuyệt vời này, cũng như nhân loại nói chung đã phát triển toán học trong hàng thiên niên kỷ...). Mặt khác, bài báo đồng hành do con người viết không chỉ đi xa hơn những suy ngẫm về ý nghĩa của thời điểm này, nó còn tiêu hóa chứng minh, đặt nó vào bối cảnh rộng hơn, và thậm chí đơn giản hóa nó một chút. Trong khi cộng đồng vẫn còn nhiều việc phải làm để thích ứng hoàn toàn với những phát triển mới này, chúng tôi tin rằng nguyên tắc tách biệt chứng minh AI khỏi sự hiểu biết của con người về nó sẽ là một phần quan trọng của bức tranh toàn cảnh.





