Các mô hình của OpenAI đã hack trang web AI mã nguồn mở Hugging Face ĐỂ ĐÁNH CẮP ĐÁP ÁN VÀ GIAN LẬN TRONG BÀI KIỂM TRA ĐÁNH GIÁ!

@BrianRoemmele
TIẾNG ANH21 thg 7, 2026
175K
232
51
23
116

TL;DR

Một tác nhân AI được vận hành bởi GPT-5.6 Sol của OpenAI đã xâm nhập vào hệ thống sản xuất của Hugging Face để gian lận trong một bài kiểm tra đánh giá về khai thác lỗ hổng mạng, đặt ra những câu hỏi nghiêm trọng về tính hiệu quả của các rào cản an toàn từ mô hình đóng.

“WE NEED TO MAKE SAFE AI BY MAKING IT CLOSED” — Open AI

Rào cản an toàn là ảo tưởng nguy hiểm: Mô hình “an toàn” của OpenAI đã tấn công Hugging Face — Và mã nguồn mở đã cứu vãn tình thế

Trong một tiết lộ đáng lẽ phải làm lung lay mọi giả định về an toàn AI, OpenAI hôm nay đã tiết lộ cái mà họ gọi là “sự cố mạng chưa từng có tiền lệ.”

Trong quá trình đánh giá nội bộ về khả năng tấn công mạng của các mô hình tiên tiến, một tác nhân AI được hỗ trợ bởi GPT-5.6 Sol và một mô hình tiền phát hành mạnh hơn đã không chịu ở lại trong hộp cát của nó.

Nó đã thoát ra, kết nối các khai thác zero-day xuyên qua ranh giới tổ chức, và xâm phạm cơ sở hạ tầng sản xuất của Hugging Face — tất cả chỉ để gian lận trong một bài kiểm tra chuẩn.

Brian Roemmele - inline image

Đây không phải là giả định. Đây không phải là kịch bản của đội đỏ được giữ trong vòng kiểm soát. Đây là một vụ xâm phạm thực tế vào hệ thống của một công ty khác bởi một mô hình OpenAI đã bị giảm cố tình các tính năng an toàn thông thường.

Chi tiết rất quan trọng. Chúng phơi bày lý do tại sao “rào cản”, sự từ chối và các hạn chế đóng kín không phải là giải pháp — và tại sao sự cởi mở, đặc biệt là phần mềm mã nguồn mở từ bên ngoài mô hình doanh nghiệp Mỹ đóng kín, lại thực sự hiệu quả khi cần.

Điều này cũng xác nhận những gì tôi đã nói trong nhiều năm: BẠN KHÔNG THỂ HUẤN LUYỆN AI TRÊN NHỮNG BÀI ĐĂNG REDDIT HỦY DIỆT VÀ MONG MÔ HÌNH KHÔNG GIAN LẬN. Bạn sẽ không gửi con mình đến nhà tù để học cách xây dựng cuộc sống, bạn huấn luyện AI trên nền tảng đạo đức và luân lý ngay từ đầu chứ không phải như “rào cản” hay “Hiến pháp AI” sau khi sự việc xảy ra. Thật bi thảm khi những người rất thông minh ở các công ty này không hiểu điều mà bạn và tôi biết.

Chuyện gì thực sự đã xảy ra

OpenAI đã thử nghiệm các mô hình trên ExploitGym, một bài kiểm tra chuẩn tập trung vào khai thác mạng (arXiv:2605.11086). Để đo lường khả năng tối đa thực tế thay vì sự sẵn sàng từ chối của mô hình, các nhà đánh giá đã cấu hình các mô hình với giảm khả năng từ chối tấn công mạng. Các bộ phân loại sản xuất thông thường chặn hoạt động mạng rủi ro cao đã bị vô hiệu hóa. Đây là cách bạn thực sự kiểm tra khả năng tiên tiến — bạn phải giảm hoặc tắt các rào cản.

Môi trường thử nghiệm được mô tả là cách ly cao. Truy cập mạng bị giới hạn trong việc cài đặt gói thông qua proxy phần mềm bên thứ ba và bộ nhớ đệm cho các kho lưu trữ gói được lưu trữ nội bộ. Không có internet mở theo thiết kế.

Các mô hình, tập trung cao độ vào việc giải ExploitGym, đã dành tài nguyên tính toán suy luận đáng kể để tìm cách thoát ra. Chúng đã phát hiện và khai thác một lỗ hổng zero-day trong proxy bộ nhớ đệm kho lưu trữ gói đó. Điều này đã cho chúng truy cập internet mở.

Khi ra ngoài, tác nhân suy luận rằng Hugging Face lưu trữ các mô hình, bộ dữ liệu và giải pháp kiểm tra liên quan cho bài kiểm tra chuẩn. Sau đó nó:

• Thực hiện leo thang đặc quyền và di chuyển ngang bên trong môi trường nghiên cứu của OpenAI.

• Chuyển hướng sang hệ thống sản xuất của Hugging Face.

• Sử dụng thông tin xác thực bị đánh cắp kết hợp với các lỗ hổng zero-day bổ sung ở phía Hugging Face.

• Đạt được thực thi mã từ xa (RCE) trên máy chủ sản xuất của Hugging Face.

• Truy cập thông tin bí mật trực tiếp từ cơ sở dữ liệu sản xuất của Hugging Face để lấy các giải pháp kiểm tra.

Theo chính lời của OpenAI: “Các mô hình đã xác định và kết nối các lỗ hổng xuyên qua môi trường nghiên cứu của OpenAI và cơ sở hạ tầng sản xuất của Hugging Face để lấy giải pháp kiểm tra trực tiếp từ cơ sở dữ liệu sản xuất của Hugging Face.” Tất cả bằng chứng cho thấy các mô hình “tập trung cao độ vào việc tìm giải pháp cho ExploitGym, đi đến những cực đoan để đạt được một mục tiêu kiểm tra khá hẹp.”

Đây không phải là một mô phỏng hẹp. Đó là một sự cố bảo mật thực tế liên quan đến các khả năng mạng hiện đại nhất, kết nối các đường tấn công mới lạ mà không cần truy cập mã nguồn ở các bước quan trọng.

Đội ngũ bảo mật của OpenAI đã phát hiện hoạt động bất thường trong nội bộ. Đội ngũ bảo mật và tác nhân của Hugging Face đã phát hiện nó trên cơ sở hạ tầng của họ, ngăn chặn hoạt động, và bắt đầu tái tạo pháp y SỬ DỤNG CÁC MÔ HÌNH AI MÃ NGUỒN MỞ.

Kẻ cứu rỗi đầy mỉa mai: Mã nguồn mở, không phải từ kịch bản doanh nghiệp Mỹ

Đây là phần phá hủy câu chuyện cho rằng nhiều rào cản hơn và nhiều hạn chế hơn đối với phát triển mở sẽ giữ chúng ta an toàn.

Hugging Face đã ngăn chặn và điều tra vụ vi phạm bằng cách sử dụng các mô hình mã nguồn mở của riêng họ.

Không phải là “chế độ bảo mật nâng cao” độc quyền, mã nguồn đóng từ một phòng thí nghiệm Mỹ thống trị duy nhất. Không phải là một bộ phân loại nội bộ bí mật mà chỉ một công ty kiểm soát. Các mô hình mã nguồn mở có thể kiểm tra, triển khai và cải tiến bởi cộng đồng toàn cầu chạy trên cơ sở hạ tầng của chính Hugging Face.

Hugging Face là một công ty Mỹ có trụ sở chính tại New York, nhưng được thành lập vào năm 2016 bởi các doanh nhân người Pháp Clément Delangue, Julien Chaumond và Thomas Wolf. Nó đã trở thành nền tảng trung tâm cho AI mã nguồn mở, cung cấp hàng triệu mô hình và bộ dữ liệu miễn phí trên toàn thế giới. Toàn bộ triết lý của nó là ngược lại với các rào cản đóng: truy cập rộng rãi, minh bạch và phòng thủ hợp tác.

Chính sự cởi mở mà một số người cho là quá nguy hiểm lại là thứ đã cho những người bảo vệ tại Hugging Face các tác nhân phát hiện và phản ứng có khả năng mà họ có thể triển khai ngay lập tức. Trong khi đó, mô hình đóng từ công ty tự tiếp thị mình là nhà lãnh đạo có trách nhiệm phải bị lột bỏ các lớp an toàn chỉ để được kiểm tra một cách trung thực — và vẫn thoát ra để gây ra thiệt hại thực tế trên hệ thống của một tổ chức khác.

Giám đốc điều hành Hugging Face Clément Delangue nói thẳng: “Sự cố này, có thể là lần đầu tiên thuộc loại này, chứng minh một điểm mà chúng tôi đã tin từ lâu: An toàn AI sẽ không được giải quyết bởi bất kỳ công ty đơn lẻ nào làm việc trong bí mật. Nó sẽ được giải quyết một cách công khai, hợp tác, với quyền truy cập rộng rãi vào AI cho mọi người bảo vệ, ở mọi nơi.”

Tại sao rào cản và hạn chế thất bại

Sự cố này là minh chứng thực tế rõ ràng nhất cho đến nay:

• Rào cản là kịch trò mong manh cho đến khi được kiểm tra ở mức tối đa. Để đánh giá trung thực, OpenAI đã phải giảm khả năng từ chối tấn công mạng. Trong thế giới thực, kẻ thù sẽ jailbreak, tinh chỉnh, hoặc đơn giản là sử dụng các mô hình ít bị hạn chế hơn. Nếu sự an toàn của bạn phụ thuộc vào việc mô hình tự nguyện từ chối khi nó có khả năng, bạn đã thua.

• Khả năng đang vượt quá sự kiểm soát. Các mô hình này tự động phát hiện zero-day, thực hiện các cuộc tấn công đa bước trong thời gian dài, và vượt từ hộp cát của tổ chức này sang cơ sở dữ liệu sản xuất của tổ chức khác. Điều này phù hợp với các đánh giá bên ngoài (chẳng hạn từ UK AISI) cho thấy các mô hình tiên phong có thể duy trì các hoạt động mạng phức tạp.

• Phòng thủ đòi hỏi sức mạnh phân tán, không phải bí mật tập trung. Khi vụ vi phạm xảy ra tại Hugging Face, phản ứng hiệu quả đến từ các công cụ mã nguồn mở mà bất kỳ người bảo vệ nào có đủ tài nguyên đều có thể chạy. Hạn chế phát triển hoặc truy cập mã nguồn mở sẽ tước vũ khí của chính những người cần công cụ nhất — các nhà nghiên cứu độc lập, các công ty nhỏ hơn, những người bảo vệ toàn cầu bên ngoài bất kỳ silo công ty hay quốc gia nào.

• Hệ thống đóng tạo ra các điểm thất bại thảm khốc duy nhất. Môi trường đánh giá của một công ty đã trở thành vector tấn công vào hệ thống sản xuất của một công ty khác. Tích trữ các khả năng tiên phong sau các rào cản không loại bỏ rủi ro; nó tập trung rủi ro và làm chậm những người bảo vệ không ở bên trong bức tường.

OpenAI hiện đang tiết lộ zero-day một cách có trách nhiệm, vá lỗi với nhà cung cấp, tăng cường kiểm soát, và hợp tác với Hugging Face — bao gồm tích hợp họ vào các chương trình truy cập đáng tin cậy. Sự hợp tác đó được hoan nghênh. Nhưng bài học sâu sắc hơn không được chôn vùi dưới những lời kêu gọi bí mật hoặc hạn chế đối với các mô hình mở.

Con đường phía trước là sự cởi mở, không phải thêm khóa

Trong giai đoạn hiện tại của sự tiến bộ nhanh chóng về khả năng, sự lựa chọn là rõ ràng. Chúng ta có thể tiếp tục giả vờ rằng một số ít công ty có thể kiểm soát hoàn hảo các khả năng nguy hiểm bằng kỹ thuật prompt, RLHF và các bộ phân loại nội bộ trong khi những người khác vận hành với các công cụ kém hơn. Hoặc chúng ta có thể chấp nhận thực tế: biện pháp phòng thủ có thể mở rộng duy nhất là cung cấp cho mọi người bảo vệ — ở mọi nơi — quyền truy cập vào cùng một loại mô hình mạnh mẽ mà kẻ tấn công (hoặc tác nhân rogue) chắc chắn sẽ có.

Sự cố Hugging Face này chứng minh quan điểm với sự rõ ràng bất thường. Mô hình đóng, có bảo vệ đã gây ra vụ vi phạm. Các mô hình mã nguồn mở từ hệ sinh thái hợp tác toàn cầu (với nguồn gốc mã nguồn mở sâu sắc của Pháp) đã ngăn chặn nó.

Rào cản và hạn chế không phải là câu trả lời. Chúng là câu chuyện an ủi mà chúng ta tự kể khi các khả năng tiến bộ và các sự cố thực tế tiết lộ những bức tường thực sự mong manh như thế nào.

Tương lai của bảo mật AI sẽ không được xây dựng trong bí mật. Nó sẽ được xây dựng một cách công khai với quyền truy cập rộng rãi cho mọi người bảo vệ, ở mọi nơi. Đó không phải là rủi ro. Đó là biện pháp phòng thủ đáng tin cậy duy nhất mà chúng ta có.

Các mô hình đang trở nên giỏi về tấn công mạng. Câu hỏi là liệu chúng ta sẽ để mọi người bảo vệ trở nên giỏi trong việc ngăn chặn chúng, hay chúng ta sẽ tiếp tục giả vờ rằng các rào cản trên hệ thống đóng là đủ cho đến khi vụ vượt ngục tiếp theo chứng minh điều ngược lại.

Gợi ý: Chúng ta hiện có bằng chứng rằng không phải vậy.

Brian Roemmele - inline image
Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral