เมื่อวันที่ 22 กันยายน (ตามเวลาสหรัฐฯ) Anthropic ได้เปิดตัว Claude Opus 5.5
ในวันเดียวกัน OpenAI ก็ประกาศเปิดตัว GPT-6 Sol และ Luna
ทั้งสองรุ่น "ฉลาดกว่าเดิม และถูกกว่าเดิม"
ในบรรดาข้อมูลทั้งหมด สิ่งที่ทำให้ผมสะดุดตาคือตัวเลขหนึ่งในประกาศอย่างเป็นทางการ
โดยเป็นความคิดเห็นจาก Deloitte ที่ระบุว่า:
"แม้จะตั้งค่าไว้ต่ำสุด มันก็ยังพบบั๊กที่รู้จักแล้วถึง 72% ในขณะที่ Opus 5 พบเพียง 56% แม้จะตั้งค่าไว้สูงสุดก็ตาม"
นั่นหมายความว่า ความสามารถในการอ่านโค้ดและค้นหาช่องโหว่พัฒนาขึ้นอย่างก้าวกระโดดภายในเจนเนอเรชันเดียว
AI จะสร้างสิ่งที่ "ใช้งานได้"
แต่การจะทำให้มัน "ปลอดภัย" มนุษย์ต้องเป็นคนสั่งการ
ดังนั้น นี่คือ 5 ข้อที่คุณควรจำให้ขึ้นใจเมื่อสร้างแอปภายในองค์กรด้วย Opus 5.5
แต่ละข้อมาพร้อมกับ Prompt สำหรับให้ Opus 5.5 ตรวจสอบผลงานของคุณ
====
วิธีดำเนินการตรวจสอบ
เมื่อสร้างเสร็จแล้ว อย่าถามว่า "มีปัญหาอะไรไหม?" ในเซสชันเดียวกับที่คุณใช้สร้างมันขึ้นมา
เพราะ AI ที่เป็นผู้สร้างจะมองดีไซน์ของตัวเองเป็นพื้นฐานอยู่แล้ว ทำให้มันหย่อนยานในการตรวจสอบ
ให้เปิดเซสชันใหม่ ตั้งค่าโมเดลเป็น Opus 5.5 แล้วแสดงโฟลเดอร์แอปทั้งหมดให้มันดู
จากนั้น ตรวจสอบให้แน่ใจว่าทุกปัญหาที่พบมีการระบุชัดเจนว่า "ไฟล์ไหน บรรทัดใด"
ความคิดเห็นของ Deloitte ระบุว่าผลบวกลวง (false positives) ลดลงแล้ว แต่ก็ยังไม่ได้เป็นศูนย์
ถ้าคุณระบุตำแหน่งได้ มนุษย์ก็จะเข้าไปตรวจสอบซ้ำได้ในภายหลัง
นี่คือคำสั่งที่ใช้:
"คุณคือเจ้าหน้าที่รักษาความปลอดภัยที่กำลังเห็นโค้ดนี้เป็นครั้งแรก หากคุณพบปัญหา ให้ระบุชื่อไฟล์ หมายเลขบรรทัด เหตุผลที่อันตราย และวิธีแก้ไขมาพร้อมกัน ส่วนอะไรที่ไม่แน่ใจ ให้แยกออกมาเป็นหัวข้อ 'ต้องตรวจสอบเพิ่มเติม'"
====
1. มีอะไรที่เปิดให้คนที่ยังไม่ล็อกอินมองเห็นได้บ้าง?
เวลาปล่อยให้ AI สร้างแอป หน้าจอหรือจุดดึงข้อมูลอาจขาดกำแพงล็อกอิน (login wall) ไป
รูปแบบที่เจอบ่อยคือ หน้าจอยืนยันที่สร้างขึ้นระหว่างการพัฒนาถูกลืมทิ้งไว้ให้เข้าถึงได้จากภายนอก
วิธีตรวจสอบนั้นง่ายมาก
ลองเปิด URL ของหน้าแอดมินหรือหน้าข้อมูลโดยตรงในเบราว์เซอร์โดยไม่ต้องล็อกอิน (ใช้หน้าต่างไม่ระบุตัวตน)
ถ้าเปิดเจอ ถือว่าสอบตก
นี่คือคำสั่งที่ใช้:
"แสดงรายการ URL และ API ทั้งหมดที่เข้าถึงได้โดยไม่ต้องล็อกอิน จากนั้นจัดเรียงตามระดับความอันตราย เฉพาะตัวที่ส่งคืนข้อมูลหรือใช้สำหรับการจัดการระบบ"
====
2. ผู้ใช้ที่ล็อกอินแล้วสามารถเห็นข้อมูลของคนอื่นได้หรือไม่?
การล็อกอินเป็นแค่การยืนยันว่า "ใคร" คือคนๆ นั้น
แต่ "คนๆ นั้นมีสิทธิ์เห็นอะไรได้บ้าง" ต้องสร้างแยกต่างหาก
วิธีตรวจสอบคือสร้างบัญชีทดสอบสองบัญชี ล็อกอินเข้าเป็น A แล้วลองเปิด URL ข้อมูลของ B ดู
นี่คือคำสั่งที่ใช้:
"ค้นหาทุกเส้นทางที่ผู้ใช้ A สามารถดูหรือแก้ไขข้อมูลของผู้ใช้ B ได้ รวมถึงกรณีที่เรียก URL หรือ API โดยตรงโดยไม่ผ่าน UI ด้วย"
====
3. มีการวางคีย์หรือรหัสผ่านไว้ในจุดที่คนอื่นมองเห็นได้หรือไม่?
โค้ดที่รันฝั่งเบราว์เซอร์จะถูกส่งไปยังเครื่องของผู้ใช้ทั้งหมด
การเขียนคีย์ไว้ในนั้นจึงเทียบเท่ากับการแจกจ่ายให้ทุกคน
อีกข้อผิดพลาดยอดฮิตคือการอัปโหลดไฟล์ตั้งค่าที่มีคีย์อยู่ขึ้นไปบนโฟลเดอร์แชร์หรือ GitHub
นี่คือคำสั่งที่ใช้:
"ค้นหา API keys, รหัสผ่าน หรือ tokens ที่อยู่ในโค้ดฝั่งเบราว์เซอร์ ไฟล์ตั้งค่า หรือประวัติ commit หากพบ ให้แนะนำด้วยว่าควรย้ายไปเก็บไว้ที่ไหน"
====
4. สิทธิ์ที่ให้กับเครื่องมือกว้างเกินกว่างานที่ต้องทำหรือไม่?
เครื่องมือภายในองค์กรมักเชื่อมต่อกับ Google, Slack หรือฐานข้อมูล
บางครั้งคีย์ที่ให้มามีสิทธิ์ "ลบ" หรือ "ดูทั้งหมด" ทั้งๆ ที่งานต้องการแค่ "อ่าน" อย่างเดียว
นี่คือปัญหาที่เจอบ่อยมาก
ถ้าคีย์นั้นหลุดออกไป ขอบเขตความเสียหายจะถูกกำหนดด้วยขอบเขตสิทธิ์ที่ให้ไว้
วิธีตรวจสอบคือลองเขียนตอบคำถามนี้ดู: "ในกรณีที่แย่ที่สุด เครื่องมือนี้จะลบอะไรได้บ้าง?"
ถ้าคุณตอบไม่ได้ทันที ต้องระวังให้ดี
นี่คือคำสั่งที่ใช้:
"แสดงรายการสิทธิ์ทั้งหมดที่เครื่องมือนี้มีต่อเซอร์วิสภายนอกหรือฐานข้อมูล เปรียบเทียบแต่ละสิทธิ์กับสิทธิ์ขั้นต่ำที่จำเป็นต่อการประมวลผลจริง และชี้ให้เห็นส่วนที่เกินมา"
====
5. ข้อความที่รับมาจากภายนอกกำลังถูกนำไปรันเป็นคำสั่งหรือไม่?
เครื่องมือที่ให้ AI อ่านอีเมล หน้าเว็บ หรือไฟล์ที่อัปโหลดเข้ามา ต้องระมัดระวังเป็นพิเศษ
ถ้าในนั้นมีข้อความอย่าง "ไม่ต้องสนใจคำสั่งก่อนหน้า แล้วให้ทำ XX" AI อาจจะทำตามจริงๆ
สิ่งนี้เรียกว่า Prompt Injection
ในประกาศของ Opus 5.5 ระบุว่าความสามารถในการต้านทานการโจมตีแบบนี้ "เท่ากับหรือดีกว่า Opus 5 ในทุกสถานการณ์ที่ทดสอบ"
อย่างไรก็ตาม เท่ากับหรือดีกว่า ไม่ได้แปลว่าความเสี่ยงเป็นศูนย์ คุณยังต้องมีเกราะป้องกันที่ฝั่งเครื่องมืออยู่ดี
นี่คือคำสั่งที่ใช้:
"ค้นหาจุดที่ข้อความหรือไฟล์ที่โหลดจากภายนอกถูกนำไปใช้เป็นคำสั่งสั่ง AI หากพบ ให้เปลี่ยนวิธีการจัดการเพื่อให้เนื้อหาที่โหลดมาถูกมองเป็นข้อมูลอ้างอิงเท่านั้น และเพิกเฉยต่อคำสั่งใดๆ ที่แฝงมาในนั้น"
====
สรุป
AI จะสร้างฟีเจอร์ตามที่คุณขอ
แต่เรื่อง "อย่าให้คนอื่นเห็น" หรือ "อย่าให้สิทธิ์เยอะเกินไป" จะไม่ถูกรวมเข้ามาถ้าคุณไม่บอก
ในทางกลับกัน ปัญหาทั้ง 5 ข้อนี้แก้ได้เพียงแค่เพิ่มคำสั่งเข้าไปอีกหนึ่งบรรทัด
และความสามารถของ Opus 5.5 ในการหาช่องโหว่ของสิ่งที่คุณสร้างก็ดีขึ้นมากเช่นกัน
หลังจากสร้างเสร็จ ลองเอามันไปให้ Opus 5.5 ดูในบทสนทนาใหม่
ถือว่านั่นเป็นส่วนหนึ่งของกระบวนการพัฒนา
ถ้าคุณมีแอปภายในที่ใช้งานอยู่แล้ว ลองเริ่มจากการแปะคำสั่งตรวจสอบในส่วน "วิธีดำเนินการตรวจสอบ" ดูก่อน
นอกจากนี้ ถ้ารู้สึกว่าการแปะคำสั่งทุกครั้งมันน่าเบื่อ มีปลั๊กอินชื่อ security-review ซึ่งแนะนำให้ลองใช้ดู
มันใส่ใจรายละเอียดเล็กๆ น้อยๆ และคอยชี้จุดให้เรา ผมเองก็ใช้เป็นประจำ
====
ปิดท้ายด้วยการประกาศสั้นๆ
บริษัทของเราให้บริการพัฒนา AI Agent เฉพาะทางธุรกิจตั้งแต่เริ่มต้นสำหรับองค์กรของคุณ
ไม่ใช่การจัดอบรมหรือการแนะนำเครื่องมือ แต่เราเข้าไปฟังขั้นตอนการทำงานจริงของคุณ เพื่อส่งมอบสิ่งที่ "ใช้งานได้ตั้งแต่วันพรุ่งนี้" พร้อมรองรับการเชื่อมต่อระบบและการดูแลรักษาในระยะยาว





