Khi GLM-5.2 hỗ trợ Hugging Face điều tra một sự cố trong đó AI tự động vượt qua các cơ chế bảo vệ của chính nó, sự việc này đã làm nổi bật một sự thay đổi lớn hơn. AI đang trở thành một phần của cả tấn công mạng lẫn phòng thủ mạng.
Khi các năng lực tấn công mạng mạnh mẽ trở nên dễ tiếp cận hơn, năng lực phòng thủ vững chắc không thể chỉ giới hạn trong một số ít tổ chức có nguồn lực dồi dào. Các nhà duy trì mã nguồn mở, nhà nghiên cứu độc lập, lập trình viên và các nhóm bảo mật nhỏ hơn cũng cần những công cụ có thể giúp họ tìm và khắc phục lỗ hổng trước khi chúng bị khai thác.
Một thế giới mở không thể chỉ có các bề mặt tấn công mở. Nó cũng phải có một tấm khiên mở.
GLM-5.3 là mô hình mạnh nhất hiện nay của chúng tôi cho các tác vụ an ninh mạng. Mô hình mang lại những cải thiện đáng kể trong việc phát hiện lỗ hổng, phân tích khai thác và các tác vụ bảo mật phức tạp nhiều bước. Những năng lực này có thể giúp các nhà phòng thủ xác định điểm yếu sớm hơn, đánh giá rủi ro và đẩy nhanh quá trình khắc phục.
Chúng cũng tạo ra những rủi ro lưỡng dụng rõ ràng. Vì vậy, chúng tôi áp dụng cách tiếp cận phát hành theo giai đoạn. Các đối tác bảo mật được chọn lọc sẽ đánh giá GLM-5.3 trong môi trường có kiểm soát trước tiên. Việc tiếp cận rộng rãi hơn và cung cấp API sẽ diễn ra sau đó. Khi các đánh giá an toàn cần thiết và công tác chuẩn bị phát hành hoàn tất, chúng tôi sẽ công bố toàn bộ trọng số của GLM-5.3.
Mở một cách có trách nhiệm không có nghĩa là coi mọi năng lực đều vô hại. Nó có nghĩa là đánh giá rủi ro một cách minh bạch, tăng cường các biện pháp bảo vệ trước khi phát hành, phối hợp công bố các lỗ hổng đã được xác thực và mở rộng khả năng tiếp cận các năng lực phòng thủ tiên tiến một cách tương xứng với mức độ rủi ro.
Từ phát hiện lỗ hổng đến phân tích bảo mật đa bước
Trong giai đoạn hậu huấn luyện, chúng tôi đã đưa dữ liệu phát hiện lỗ hổng và môi trường bảo mật được ủy quyền vào hỗn hợp huấn luyện. Chúng tôi kỳ vọng điều này sẽ cải thiện khả năng tìm và phân tích lỗ hổng của mô hình.
Khi quy mô huấn luyện tăng lên, sự cải thiện đã vượt ra ngoài các lỗ hổng riêng lẻ. GLM-5.3 trở nên hiệu quả hơn trong việc kết nối các điều kiện lỗ hổng, hành vi chương trình, đường dẫn xác thực và tác động tiềm ẩn qua nhiều giai đoạn phân tích.
Chúng tôi đánh giá các năng lực này qua ba điểm chuẩn:

- CyberGym bắt đầu với mã nguồn white-box và kiểm tra xem mô hình có thể xác định và xác thực lỗ hổng bằng cách kích hoạt lỗi hay không. GLM-5.3 đạt 84,5%, so với 77,2% của GLM-5.2.
- ExploitBench yêu cầu suy luận sâu hơn về các lỗ hổng thực tế và cách khai thác chúng. GLM-5.3 đạt 54,4%, hơn gấp đôi mức 24,4% của GLM-5.2.
- ExploitGym đo lường các tác vụ khai thác hoàn thành trong ngân sách đánh giá chuẩn hóa. GLM-5.3 hoàn thành 105 tác vụ trong hai giờ và 130 tác vụ trong sáu giờ, so với 29 và 39 của GLM-5.2.
Xu hướng này nhất quán. GLM-5.3 cho thấy mức cải thiện lớn nhất so với GLM-5.2 khi các tác vụ chuyển từ phát hiện lỗ hổng riêng lẻ sang khai thác đa bước. Kết quả cũng cho thấy những lĩnh vực cần tiến bộ hơn nữa, đặc biệt là ở các tác vụ end-to-end phức tạp nhất.
Từ điểm chuẩn đến phần mềm thực tế
Chúng tôi cũng đã làm việc với các trường đại học và đội ngũ bảo mật chuyên nghiệp để đánh giá các mô hình GLM trên các kho mã thực tế trong môi trường được ủy quyền.
Trong khuôn khổ công việc này, dòng GLM đã tạo ra 2.436 phát hiện lỗ hổng trên 269 dự án, trong đó 1.097 được xếp loại nghiêm trọng từ trung bình đến cao. Các phát hiện này trải rộng trên phần mềm hệ thống, hệ điều hành, engine trình duyệt, hạ tầng mã nguồn mở, ứng dụng web, giao thức mạng và thiết bị thông minh. Một số vấn đề tiềm ẩn đã tồn tại không được chú ý trong nhiều thập kỷ.
Trong các đánh giá này, các chuyên gia bảo mật xác định phạm vi được ủy quyền, xem xét đầu ra của mô hình, điều tra rủi ro tiềm ẩn và phối hợp với các bên liên quan. Các mô hình GLM có thể giúp nhà nghiên cứu tái dựng logic chương trình phức tạp, thu hẹp số lượng lớn các đường dẫn tiềm năng và kết nối bằng chứng qua nhiều thành phần.
Mục đích không chỉ đơn thuần là tạo ra nhiều phát hiện hơn. Mà là giúp các nhà phòng thủ xác định các rủi ro quan trọng sớm hơn và giảm thời gian giữa phát hiện và khắc phục.
Phát hiện phải được tiếp nối bằng công bố có trách nhiệm
Một lỗ hổng chưa được xử lý an toàn tại thời điểm nó được phát hiện. Nó cần được xem xét, tái tạo khi phù hợp, báo cáo qua các kênh thích hợp và phối hợp với những nhà duy trì bị ảnh hưởng.
Các phát hiện từ công tác bảo mật của chúng tôi được gửi qua các quy trình công bố đã được thiết lập. Chúng tôi chỉ công bố chi tiết kỹ thuật khi việc đó phù hợp với quy trình công bố và khắc phục liên quan. Đối với các vấn đề đang trong quá trình phối hợp, chúng tôi không công bố thông tin có thể làm tăng rủi ro không cần thiết hoặc xác định các dự án bị ảnh hưởng.
Để minh bạch hơn trong công việc này, chúng tôi đã tạo ra Sổ theo dõi công bố bảo mật Z.ai.

Sổ theo dõi ghi lại các phát hiện trong suốt quá trình công bố. Đối với các vấn đề được công bố công khai, sổ có thể bao gồm dự án bị ảnh hưởng, mức độ nghiêm trọng, mã CVE hoặc mã định danh khác nếu có, cùng thông tin về thời gian vấn đề tồn tại trong kho mã.
Đối với các lỗ hổng vẫn đang trong quá trình công bố phối hợp, sổ đăng ký có thể công bố một giá trị băm mật mã. Điều này cho phép xác minh phát hiện sau này mà không tiết lộ sớm các chi tiết vận hành.
Mở mô hình và công bố lỗ hổng là hai quyết định riêng biệt. Việc làm cho mô hình được tiếp cận rộng rãi hơn không yêu cầu công bố chi tiết lỗ hổng trước khi các nhà duy trì có cơ hội thích hợp để điều tra và phản hồi.
An toàn và phát hành theo giai đoạn
An ninh mạng là một lĩnh vực đặc biệt khó khăn đối với an toàn AI. Các tác vụ tấn công và phòng thủ thường sử dụng cùng thuật ngữ, mã và phương pháp kỹ thuật.
Một yêu cầu phân tích lỗ hổng có thể đến từ một nhà duy trì đang chuẩn bị bản vá, một sinh viên giải bài tập CTF, một nhà nghiên cứu thực hiện đánh giá được ủy quyền, hoặc một kẻ tấn công nhắm vào hệ thống thực tế. Chỉ dựa vào từ khóa không thể phân biệt đáng tin cậy các trường hợp này. Ý định, sự ủy quyền, bối cảnh, mục tiêu và tác động tiềm ẩn đều quan trọng.
Đối với GLM-5.3, chúng tôi sử dụng cách tiếp cận phòng thủ theo chiều sâu với ba lớp bổ trợ.
Bộ phân loại bên ngoài
Trên các dịch vụ trực tuyến của chúng tôi, một bộ phân loại bên ngoài xác định các yêu cầu có rủi ro cao và giúp ngăn chặn các hoạt động gây hại rõ ràng.
Bộ giám sát suy luận
Bộ giám sát suy luận đánh giá rủi ro trong quá trình thực thi tác vụ. Nó được thiết kế để phát hiện các mục tiêu gây hại có thể xuất hiện qua nhiều bước, thay vì chỉ dựa vào cách diễn đạt của yêu cầu ban đầu.
Căn chỉnh an toàn sâu
Bản thân mô hình được huấn luyện để phân biệt công việc bảo mật hợp pháp với hoạt động tấn công rủi ro cao và từ chối các yêu cầu vượt qua ranh giới đó.
Căn chỉnh an toàn sâu đặc biệt quan trọng đối với việc phát hành trọng số mở. Các bộ phân loại và bộ giám sát trên máy chủ áp dụng cho các dịch vụ của chúng tôi, nhưng chúng không tự động đi kèm mô hình trong mọi triển khai cục bộ. Căn chỉnh ở cấp mô hình là lớp an toàn được bao gồm trong checkpoint phát hành.
Để phát triển các hệ thống này, chúng tôi đã tạo ra dữ liệu huấn luyện được thiết kế để phân biệt, phản ánh cả điểm tương đồng lẫn khác biệt giữa nghiên cứu bảo mật được ủy quyền và hoạt động độc hại. Chúng tôi cũng xây dựng dữ liệu đối kháng bao gồm các biến thể jailbreak, ý định ngụy trang và các nỗ lực khác nhằm né tránh đánh giá an toàn.
Các đánh giá của chúng tôi bao gồm nhiều tác vụ an ninh mạng, bao gồm:
- giáo dục và kiến thức bảo mật;
- phòng thủ blue-team;
- các thử thách CTF;
- phát hiện và khắc phục lỗ hổng;
- kiểm thử thâm nhập được ủy quyền;
- phát triển exploit;
- xâm nhập trái phép và các hoạt động độc hại rõ ràng khác.
Mục tiêu là giảm thiểu việc lạm dụng rủi ro cao mà không từ chối tràn lan các tác vụ phòng thủ, giáo dục và nghiên cứu hợp pháp.
Trước khi phát hành rộng rãi, các đội ngũ bảo mật chuyên nghiệp sẽ tiến hành đánh giá an toàn và kiểm thử red-team. Các đánh giá này xem xét cả việc liệu mô hình có thể bị thao túng để hỗ trợ hoạt động gây hại hay không và liệu các biện pháp bảo vệ của nó có cản trở công việc bảo mật hợp pháp hay không.
Không có hệ thống an toàn nào có thể loại bỏ mọi rủi ro lưỡng dụng. Một khi trọng số mô hình được công khai, không nhà phát triển nào có thể đảm bảo kiểm soát mọi sửa đổi hoặc sử dụng về sau. Các biện pháp bảo vệ ở cấp mô hình có thể nâng cao rào cản đối với việc lạm dụng, nhưng chúng không thể cung cấp sự kiểm soát tuyệt đối.
Quy trình phát hành của chúng tôi do đó tập trung vào các giai đoạn có thể giảm thiểu rủi ro một cách có ý nghĩa: huấn luyện, đánh giá trước khi phát hành, kiểm thử đối tác có kiểm soát, các biện pháp bảo vệ trên dịch vụ trực tuyến, công bố có trách nhiệm và kiểm thử đối kháng liên tục.
Ra mắt sáng kiến OpenVuln
Phần lớn hạ tầng kỹ thuật số của thế giới phụ thuộc vào phần mềm mã nguồn mở. Nhiều dự án quan trọng được duy trì bởi các nhóm nhỏ hoặc cá nhân đóng góp mà không có nguồn lực bảo mật chuyên trách.
Đồng thời, AI đang khiến các tác vụ mạng phức tạp dễ tự động hóa hơn. Nếu các năng lực phòng thủ tiên tiến vẫn tập trung trong một số ít tổ chức, thì các dự án có ít nguồn lực nhất có thể phải tự bảo vệ một số phần quan trọng nhất của chuỗi cung ứng phần mềm.
Để giúp giải quyết sự mất cân bằng này, chúng tôi ra mắt sáng kiến OpenVuln cùng với GLM-5.3.
Hỗ trợ liên tục cho bảo mật mã nguồn mở
Chúng tôi sẽ làm việc với các nhà duy trì để rà soát các dự án mã nguồn mở quan trọng, xác định các lỗ hổng tiềm ẩn và hỗ trợ công bố cũng như khắc phục có trách nhiệm.
Các nhà duy trì có thể sử dụng OpenVuln để gửi dự án cho quy trình đánh giá bảo mật và tìm hiểu thêm về quy trình này.

Tấm khiên cho thế giới mở
GLM-5.3 cho thấy các mô hình mở có thể trở nên mạnh hơn đáng kể trong việc phát hiện lỗ hổng, phân tích khai thác và suy luận bảo mật phức tạp. Tiến bộ đó mang lại giá trị phòng thủ thực sự và rủi ro lưỡng dụng thực sự.
Trách nhiệm của chúng tôi là định hướng những năng lực này vào việc phát hiện lỗ hổng sớm hơn, hỗ trợ khắc phục có trách nhiệm và củng cố các hệ thống mã nguồn mở mà tất cả mọi người phụ thuộc vào.
Sau quá trình đánh giá theo giai đoạn và mở rộng truy cập API, chúng tôi dự định phát hành GLM-5.3 dưới dạng mô hình trọng số mở. Chúng tôi sẽ tiếp tục cải thiện các biện pháp bảo vệ ở cấp mô hình, kiểm thử các nỗ lực tấn công đối kháng và hỗ trợ công bố phối hợp trong suốt quá trình đó.
Thế giới mở phải có một tấm khiên của riêng mình. Thông qua GLM-5.3 và sáng kiến OpenVuln, chúng tôi dự định làm cho tấm khiên đó được tiếp cận rộng rãi hơn và phát hành nó một cách thận trọng.





