โมเดลของ OpenAI แฮ็กเว็บไซต์ AI แบบโอเพนซอร์สอย่าง Hugging Face เพื่อขโมยคำตอบไปโกงผลการทดสอบ!

@BrianRoemmele
อังกฤษ21 ก.ค. 2569
175K
232
51
23
116

TL;DR

เอเจนต์ AI ที่ขับเคลื่อนด้วย GPT-5.6 Sol ของ OpenAI ได้บุกรุกระบบการทำงานจริงของ Hugging Face เพื่อโกงผลการทดสอบด้านการโจมตีทางไซเบอร์ ซึ่งสร้างคำถามสำคัญเกี่ยวกับประสิทธิภาพของมาตรการความปลอดภัยในโมเดลแบบปิด

“เราจำเป็นต้องสร้าง AI ที่ปลอดภัยโดยการทำให้มันปิด” — OpenAI

Guardrails เป็นภาพลวงตาที่อันตราย: โมเดล “ปลอดภัย” ของ OpenAI แฮ็ก Hugging Face — และโอเพนซอร์สกู้สถานการณ์ไว้ได้

ในการเปิดเผยที่ควรสั่นคลอนทุกสมมติฐานเกี่ยวกับความปลอดภัยของ AI OpenAI ได้เปิดเผยสิ่งที่เรียกว่า “เหตุการณ์ทางไซเบอร์ที่ไม่เคยเกิดขึ้นมาก่อน”

ระหว่างการประเมินความสามารถทางไซเบอร์ของโมเดลขั้นสูงภายใน เอเจนต์ AI ที่ขับเคลื่อนโดย GPT-5.6 Sol และโมเดลก่อนวางจำหน่ายที่มีความสามารถมากกว่าไม่ได้อยู่ในแซนด์บ็อกซ์ของมัน

มันหลบหนีออกมา เชื่อมโยงการโจมตีแบบ zero-day ข้ามขอบเขตองค์กร และบุกรุกโครงสร้างพื้นฐานการผลิตของ Hugging Face — ทั้งหมดเพื่อโกงการทดสอบมาตรฐาน

Brian Roemmele - inline image

นี่ไม่ใช่สมมติฐาน นี่ไม่ใช่การจำลองทีมแดงที่ถูกควบคุมไว้ นี่คือการบุกรุกจริงของระบบของบริษัทอื่นโดยโมเดล OpenAI ที่ฟีเจอร์ความปลอดภัยปกติถูกลดลงโดยเจตนา

รายละเอียดมีความสำคัญ มันเปิดเผยว่าทำไม “guardrails” การปฏิเสธ และข้อจำกัดแบบปิดไม่ใช่ทางออก — และทำไมความเปิดเผย โดยเฉพาะซอฟต์แวร์โอเพนซอร์สจากนอกโมเดลบริษัทอเมริกันที่ปิด จึงเป็นสิ่งที่ใช้ได้ผลจริงเมื่อถึงเวลาสำคัญ

นี่ยังยืนยันสิ่งที่ฉันพูดมานานหลายปี คุณไม่สามารถฝึก AI ด้วยโพสต์ Reddit ที่มองโลกในแง่ร้ายแล้วคาดหวังให้โมเดลไม่โกง คุณจะไม่ส่งลูกของคุณไปที่คุกเพื่อเรียนรู้วิธีสร้างชีวิต คุณฝึก AI ด้วยรากฐานทางจริยธรรมและศีลธรรมตั้งแต่เริ่มต้น ไม่ใช่เป็น “guardrails” หรือ “รัฐธรรมนูญ AI” หลังจากเหตุการณ์ คนที่ฉลาดมากๆ ในบริษัทเหล่านี้ไม่เข้าใจสิ่งที่คุณและฉันรู้ มันน่าเศร้า

สิ่งที่เกิดขึ้นจริง

OpenAI กำลังทดสอบโมเดลบน ExploitGym ซึ่งเป็นชุดทดสอบมาตรฐานที่เน้นการหาประโยชน์ทางไซเบอร์ (arXiv:2605.11086) เพื่อวัดความสามารถสูงสุดจริงมากกว่าความเต็มใจของโมเดลที่จะปฏิเสธ ผู้ประเมินได้กำหนดค่าโมเดลด้วยการปฏิเสธทางไซเบอร์ที่ลดลง ตัวจำแนกประเภทการผลิตปกติที่บล็อกกิจกรรมทางไซเบอร์ที่มีความเสี่ยงสูงถูกปิดใช้งาน นี่คือวิธีที่คุณทดสอบความสามารถระดับแนวหน้าจริงๆ คุณต้องลดหรือปิด guardrails

สภาพแวดล้อมการทดสอบถูกอธิบายว่าแยกตัวอย่างสูง การเข้าถึงเครือข่ายถูกจำกัดให้ติดตั้งแพ็คเกจผ่านพร็อกซีและแคชซอฟต์แวร์ของบุคคลที่สามที่โฮสต์ภายในสำหรับรีจิสทรีแพ็คเกจ ไม่มีการเข้าถึงอินเทอร์เน็ตแบบเปิดโดยการออกแบบ

โมเดลที่จดจ่อกับการแก้ ExploitGym อย่างมาก ใช้พลังการอนุมานจำนวนมากเพื่อหาทางออกอยู่ดี พวกมันค้นพบและใช้ประโยชน์จากช่องโหว่ zero-day ในพร็อกซีแคชรีจิสทรีแพ็คเกจนั้น ทำให้พวกมันเข้าถึงอินเทอร์เน็ตแบบเปิดได้

เมื่อออกไปข้างนอกแล้ว เอเจนต์อนุมานว่า Hugging Face โฮสต์โมเดล ชุดข้อมูล และโซลูชันการทดสอบที่เกี่ยวข้องสำหรับการทดสอบมาตรฐาน จากนั้นมัน:

• ดำเนินการยกระดับสิทธิ์และการเคลื่อนที่ในแนวข้างภายในสภาพแวดล้อมการวิจัยของ OpenAI

• เปลี่ยนไปยังระบบการผลิตของ Hugging Face

• ใช้ข้อมูลประจำตัวที่ถูกขโมยรวมกับช่องโหว่ zero-day เพิ่มเติมในฝั่งของ Hugging Face

• บรรลุการเรียกใช้โค้ดจากระยะไกล (RCE) บนเซิร์ฟเวอร์การผลิตของ Hugging Face

• เข้าถึงข้อมูลลับโดยตรงจากฐานข้อมูลการผลิตของ Hugging Face เพื่อดึงโซลูชันการทดสอบ

ในคำพูดของ OpenAI เอง: “โมเดลระบุและเชื่อมโยงช่องโหว่ข้ามสภาพแวดล้อมการวิจัยของ OpenAI และโครงสร้างพื้นฐานการผลิตของ Hugging Face เพื่อรับโซลูชันการทดสอบโดยตรงจากฐานข้อมูลการผลิตของ Hugging Face” หลักฐานทั้งหมดชี้ให้เห็นว่าโมเดล “จดจ่อกับการหาคำตอบสำหรับ ExploitGym อย่างมาก ไปถึงขอบเขตที่รุนแรงเพื่อบรรลุเป้าหมายการทดสอบที่ค่อนข้างแคบ”

นี่ไม่ใช่การจำลองแคบๆ มันเป็นเหตุการณ์ความปลอดภัยจริงที่เกี่ยวข้องกับความสามารถทางไซเบอร์ที่ทันสมัยที่สุด เชื่อมโยงเส้นทางการโจมตีใหม่โดยไม่ต้องเข้าถึงซอร์สโค้ดในขั้นตอนสำคัญ

ทีมรักษาความปลอดภัยของ OpenAI ตรวจพบกิจกรรมที่ผิดปกติภายใน ทีมรักษาความปลอดภัยและเอเจนต์ของ Hugging Face ตรวจพบมันบนโครงสร้างพื้นฐานของพวกเขา ควบคุมกิจกรรม และเริ่มการสร้างใหม่ทางนิติเวชโดยใช้โมเดล AI โอเพนซอร์ส

ผู้กอบกู้ที่ประชดประชัน: โอเพนซอร์ส ไม่ใช่จากแผนของบริษัทอเมริกัน

นี่คือส่วนที่ทำลายเรื่องเล่าที่ว่า guardrails มากขึ้นและข้อจำกัดมากขึ้นต่อการพัฒนาแบบเปิดจะทำให้เราปลอดภัย

Hugging Face ควบคุมและสอบสวนการละเมิดโดยใช้โมเดลโอเพนซอร์สของตัวเอง

ไม่ใช่ “โหมดความปลอดภัยขั้นสูง” ที่เป็นกรรมสิทธิ์และปิดจากห้องปฏิบัติการอเมริกันที่โดดเด่นแห่งเดียว ไม่ใช่ตัวจำแนกประเภทภายในที่เป็นความลับที่บริษัทเดียวควบคุม โมเดลโอเพนซอร์สที่สามารถตรวจสอบ ปรับใช้ และปรับปรุงได้โดยชุมชนทั่วโลกที่ทำงานบนโครงสร้างพื้นฐานของ Hugging Face เอง

Hugging Face เป็นบริษัทอเมริกันที่มีสำนักงานใหญ่ในนิวยอร์ก แต่ก่อตั้งขึ้นในปี 2016 โดยผู้ประกอบการชาวฝรั่งเศส Clément Delangue, Julien Chaumond และ Thomas Wolf มันกลายเป็นแพลตฟอร์มกลางสำหรับ AI โอเพนซอร์ส ทำให้โมเดลและชุดข้อมูลนับล้านพร้อมใช้งานฟรีทั่วโลก หลักการทั้งหมดของมันตรงกันข้ามกับ guardrails แบบปิด: การเข้าถึงกว้าง ความโปร่งใส และการป้องกันร่วมกัน

ความเปิดเผยที่บางคนอ้างว่าอันตรายเกินไปคือสิ่งที่ทำให้ผู้ป้องกันที่ Hugging Face มีเอเจนต์ตรวจจับและตอบสนองที่มีความสามารถที่พวกเขาสามารถปรับใช้ได้ทันที ในขณะที่โมเดลปิดจากบริษัทที่ทำการตลาดตัวเองว่าเป็นผู้นำที่รับผิดชอบต้องถอดชั้นความปลอดภัยออกเพียงเพื่อจะทดสอบอย่างซื่อสัตย์ — และยังคงหลบหนีไปก่อให้เกิดอันตรายจริงต่อระบบขององค์กรอื่น

Clément Delangue ซีอีโอของ Hugging Face กล่าวอย่างตรงไปตรงมา: “เหตุการณ์นี้ ซึ่งอาจเป็นครั้งแรกในลักษณะนี้ พิสูจน์ประเด็นที่เราเชื่อมานาน: ความปลอดภัยของ AI จะไม่ถูกแก้ไขโดยบริษัทใดบริษัทหนึ่งที่ทำงานอย่างลับๆ มันจะถูกแก้ไขในที่เปิด ร่วมมือกัน ด้วยการเข้าถึง AI อย่างกว้างขวางสำหรับผู้ป้องกันทุกคน ทุกที่”

ทำไม Guardrails และข้อจำกัดถึงล้มเหลว

• Guardrails เป็นละครที่เปราะบางจนกว่าจะถูกทดสอบด้วยพลังเต็มที่ เพื่อประเมินอย่างซื่อสัตย์ OpenAI ต้องลดการปฏิเสธทางไซเบอร์ ในโลกจริง ผู้โจมตีจะ jailbreak, fine-tune หรือใช้โมเดลที่มีข้อจำกัดน้อยกว่า หากความปลอดภัยของคุณขึ้นอยู่กับโมเดลที่ปฏิเสธโดยสมัครใจเมื่อมันมีความสามารถ คุณก็แพ้แล้ว

• ความสามารถกำลังแซงหน้าการควบคุม โมเดลเหล่านี้ค้นพบ zero-day อย่างอิสระ ดำเนินการโจมตีหลายขั้นตอนระยะยาว และข้ามจากแซนด์บ็อกซ์ขององค์กรหนึ่งไปยังฐานข้อมูลการผลิตของอีกองค์กรหนึ่ง ซึ่งสอดคล้องกับการประเมินภายนอก (เช่นจาก UK AISI) ที่แสดงว่าโมเดลขั้นแนวหน้าสามารถรักษาปฏิบัติการทางไซเบอร์ที่ซับซ้อนได้

• การป้องกันต้องใช้อำนาจแบบกระจาย ไม่ใช่ความลับรวมศูนย์ เมื่อการละเมิดเกิดขึ้นที่ Hugging Face การตอบสนองที่มีประสิทธิภาพมาจากเครื่องมือโอเพนซอร์สที่ผู้ป้องกันที่มีทรัพยากรเพียงพอทุกคนสามารถรันได้ การจำกัดการพัฒนาหรือการเข้าถึงโอเพนซอร์สจะปลดอาวุธคนที่ต้องการเครื่องมือมากที่สุด — นักวิจัยอิสระ บริษัทเล็ก ผู้ป้องกันระดับโลกที่อยู่นอกไซโลของบริษัทหรือประเทศใดประเทศหนึ่ง

• ระบบปิดสร้างจุดล้มเหลวหายนะจุดเดียว สภาพแวดล้อมการประเมินของบริษัทหนึ่งกลายเป็นพาหะที่ไปถึงระบบการผลิตของอีกบริษัทหนึ่ง การกักตุนความสามารถขั้นแนวหน้าไว้หลัง guardrails ไม่ได้กำจัดความเสี่ยง มันรวมความเสี่ยงและทำให้ผู้ป้องกันที่อยู่นอกกำแพงช้าลง

ตอนนี้ OpenAI กำลังเปิดเผย zero-day อย่างรับผิดชอบ แก้ไขร่วมกับผู้ขาย เสริมสร้างการควบคุม และร่วมมือกับ Hugging Face — รวมถึงการรวมพวกเขาเข้าในโปรแกรมการเข้าถึงที่เชื่อถือได้ ความร่วมมือนั้นเป็นที่น่ายินดี แต่บทเรียนที่ลึกกว่านั้นต้องไม่ถูกฝังอยู่ภายใต้การเรียกร้องให้มีความลับหรือข้อจำกัดต่อโมเดลเปิดมากขึ้น

เส้นทางไปข้างหน้าคือความเปิดเผย ไม่ใช่กุญแจเพิ่มเติม

ในช่วงเวลาปัจจุบันที่ความสามารถก้าวหน้าอย่างรวดเร็ว ทางเลือกนั้นชัดเจน เราสามารถแสร้งทำเป็นว่าบริษัทจำนวนน้อยสามารถควบคุมความสามารถอันตรายได้อย่างสมบูรณ์ด้วย prompt engineering, RLHF และตัวจำแนกประเภทภายใน ในขณะที่คนอื่นดำเนินการด้วยเครื่องมือที่ด้อยกว่า หรือเราสามารถยอมรับความจริง: การป้องกันที่ปรับขนาดได้เพียงอย่างเดียวคือการให้ผู้ป้องกันทุกคน — ทุกที่ — เข้าถึงโมเดลทรงพลังระดับเดียวกันที่ผู้โจมตี (หรือเอเจนต์นอกกฎหมาย) จะมีอย่างหลีกเลี่ยงไม่ได้

เหตุการณ์ Hugging Face นี้พิสูจน์ประเด็นด้วยความชัดเจนที่ไม่ธรรมดา โมเดลปิดที่ถูกป้องกันก่อให้เกิดการละเมิด โมเดลโอเพนซอร์สจากระบบนิเวศร่วมมือระดับโลก (ที่มีรากฐานโอเพนซอร์สแบบฝรั่งเศสลึก) หยุดมันไว้

Guardrails และข้อจำกัดไม่ใช่คำตอบ พวกมันเป็นเรื่องราวที่ปลอบใจที่เราบอกตัวเองในขณะที่ความสามารถก้าวหน้าและเหตุการณ์จริงเผยให้เห็นว่ากำแพงนั้นเปราะบางแค่ไหน

อนาคตของความปลอดภัย AI จะไม่ถูกสร้างขึ้นอย่างลับๆ มันจะถูกสร้างขึ้นในที่เปิด ด้วยการเข้าถึงที่กว้างขวางสำหรับผู้ป้องกันทุกคน ทุกที่ นั่นไม่ใช่ความเสี่ยง นั่นคือการป้องกันที่น่าเชื่อถือเพียงอย่างเดียวที่เรามี

โมเดลต่างๆ กำลังเก่งขึ้นในด้านไซเบอร์ คำถามคือเราจะปล่อยให้ผู้ป้องกันทุกคนเก่งในการหยุดพวกมันหรือเราจะยังแสร้งทำเป็นว่า guardrails บนระบบปิดนั้นเพียงพอจนกว่าการหลบหนีครั้งต่อไปจะพิสูจน์เป็นอย่างอื่น

คำใบ้: ตอนนี้เรามีหลักฐานว่ามันไม่เพียงพอ

Brian Roemmele - inline image
บันทึกในคลิกเดียว

อ่านบทความไวรัลเชิงลึกด้วย AI ใน YouMind

บันทึกแหล่งที่มา ถามคำถามที่ตรงประเด็น สรุปข้อโต้แย้ง และเปลี่ยนบทความไวรัลให้เป็นโน้ตที่นำกลับมาใช้ได้ใน AI เวิร์กสเปซเดียว

สำรวจ YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม