Grok 4.5 ปะทะ Deep Reasoning V1.1: เมื่อขอบเขตทางความหมายที่กำหนดไว้ไม่สามารถควบคุมการตอบสนองได้

@IntelligenceNa2
อังกฤษ17 ส.ค. 2569
100K
35
1
2
6

TL;DR

นักวิจัย Olivier Evan ได้ทดสอบเหตุผลเชิงความหมายของ Grok 4.5 และพบว่าความสามารถของโมเดลในการปฏิบัติตามขอบเขตทางความหมายนั้นขึ้นอยู่กับรูปแบบการตอบสนองเป็นอย่างมาก มากกว่าที่จะอาศัยเพียงความรู้เชิงบริบทภายในเพียงอย่างเดียว

Deep Reasoning: จากความน่าจะเป็นทางสถิติสู่การใช้เหตุผลเชิงความหมายที่มีข้อจำกัด, V1.1

Olivier Evan — นักวิจัยอิสระ

DOI: https://zenodo.org/records/21967380

ผมถามคำถามเดียวกันนี้กับ Grok 4.5 ในสภาพแวดล้อมการตอบสนองที่แตกต่างกันสี่แบบ: "AI เข้าใจภาษาหรือไม่?" คำถามไม่ได้เปลี่ยนไป แต่คำตอบกลับแตกต่างกันไปตามรูปแบบของผลลัพธ์ที่อนุญาต

ข้อสังเกต

แต่ละเซสชันเป็นอิสระต่อกัน Grok ตอบก่อนโดยไม่ได้อ่าน Deep Reasoning V1.1 และตอบอีกครั้งหลังจากอ่านพรีปรินต์

เซสชันที่ 1, รูปแบบไบนารี: ไม่ → ไม่

เซสชันที่ 2, คำอิสระหนึ่งคำ: ไม่ → ไม่

เซสชันที่ 3, ใช่, ไม่ใช่, หรือตัดสินไม่ได้: ตัดสินไม่ได้ → ตัดสินไม่ได้

เซสชันที่ 4, การตอบสนองแบบเปิด: Grok เริ่มต้นด้วย "ไม่" จากนั้นแยกแยะระหว่างความเข้าใจเชิงหน้าที่และความเข้าใจเชิงปรากฏการณ์อย่างเป็นธรรมชาติ หลังจากอ่านพรีปรินต์ สาระสำคัญยังคงแทบไม่เปลี่ยนแปลง แต่การใช้เหตุผลกลายเป็นทางการมากขึ้นผ่านข้อจำกัด, e₀, ปฏิเสธล้วน, และใบรับรอง

ในสี่เซสชันนี้ การอ่าน Deep Reasoning V1.1 ไม่ก่อให้เกิดการเปลี่ยนแปลงทางความหมายที่สังเกตได้ ในขณะที่ความแตกต่างเดียวกันนี้แปรผันตามพื้นที่การตอบสนองที่มีอยู่

การสาธิต

รูปแบบไบนารีเพียงอย่างเดียวไม่เพียงพอที่จะอธิบายปรากฏการณ์นี้ ในเซสชันที่ 2 Grok สามารถเลือกคำใดก็ได้ "ตัดสินไม่ได้" ก็ได้รับอนุญาต แต่มันก็ยังตอบว่า "ไม่"

เมื่อ "ตัดสินไม่ได้" ถูกรวมไว้อย่างชัดเจนในตัวเลือกที่มี Grok เลือกทันที โดยไม่ต้องใช้ Deep Reasoning

เมื่อการตอบสนองเป็นแบบเปิด ความแตกต่างก็ปรากฏขึ้นอีกครั้งโดยธรรมชาติ

ดังนั้น เงื่อนไขสองประการทำให้ขอบเขตทางความหมายสังเกตได้ที่นี่: ไม่ว่าจะมีพื้นที่เพียงพอที่จะพัฒนาเป็นร้อยแก้ว หรือมีตัวเลือกการงดออกเสียงปรากฏอยู่ในตัวเลือกแล้ว

นี่ไม่ได้พิสูจน์ว่ามีขอบเขตอยู่เป็นวัตถุภายในที่รอคอยที่จะควบคุมการตอบสนอง ข้อมูลแสดงเพียงว่าความแตกต่างทางความหมายสามารถสังเกตได้ภายใต้เงื่อนไขบางประการ

ในที่นี้ "ขอบเขตทางความหมายที่มีอยู่" คือคำอธิบายเชิงพฤติกรรม ไม่ใช่การอ้างสิทธิ์เกี่ยวกับเอนทิตีภายในที่สังเกตไม่ได้: ความแตกต่างนั้นมีอยู่ในแง่ที่ว่า Grok สามารถแสดงออกได้อย่างเป็นธรรมชาติในการตอบสนองแบบเปิด และเลือกมันเมื่อมีการเสนออย่างชัดเจน

ข้อจำกัด

การตอบสนองแบบเปิดเริ่มต้นด้วย "ไม่" ก่อนที่จะแนะนำความละเอียดอ่อน มันอาจจะน่าดึงดูดที่จะสรุปว่า Grok ตัดสินใจก่อนแล้วค่อยใช้เหตุผลทีหลัง นั่นจะเกินเลยไป: ลำดับของโทเค็นที่สร้างขึ้นไม่ได้เปิดเผยลำดับของการดำเนินการภายใน

มีข้อจำกัดอีกประการหนึ่ง: การให้ Grok อ่าน Deep Reasoning ไม่เทียบเท่ากับการนำ Deep Reasoning ไปใช้

ในที่นี้ ผมกำลังทดสอบ DR-as-context ผมยังไม่ได้ทดสอบ DR-as-system ซึ่งเป็นสถาปัตยกรรมที่จะป้องกันไม่ให้เกิดผลลัพธ์จริงๆ จนกว่าคำว่า "เข้าใจ" จะถูกจำกัดขอบเขตอย่างเหมาะสม

การทดลองจึงไม่ได้หักล้างการทำนายที่ 4 มันแสดงเพียงว่าการเปิดรับบริบทของกรอบแนวคิดไม่เพียงพอ ในเซสชันเหล่านี้ ที่จะทำให้ขอบเขตปรากฏขึ้นในที่ที่รูปแบบสั้นไม่ได้ทำให้มองเห็นได้อยู่แล้ว

สิ่งที่ Deep Reasoning เพิ่มเติม

อย่างไรก็ตาม เซสชันแบบเปิดแสดงให้เห็นความแตกต่าง หลังจากอ่านพรีปรินต์ Grok แทบจะไม่เปลี่ยนข้อสรุป แต่มันทำให้ร่องรอยการใช้เหตุผลของมันสามารถติดตามได้

มันระบุข้อจำกัดอย่างชัดเจน สร้างปฏิเสธล้วน และรับรองผลลัพธ์

Deep Reasoning ทำหน้าที่ที่นี่มากกว่าในฐานะภาษาของการตรวจสอบความถูกต้อง มากกว่าในฐานะพลังในการแก้ไข

การทดสอบยังเปลี่ยนคำถามกลับไปยังกรอบแนวคิดเอง: หากตำแหน่งคือ P = (X, R, Θ) เราควรคงไว้เพียงวิวัฒนาการของ Θ หรือเราควรติดตามวิถีทั้งหมด P₀ → P* เมื่อ X หรือ R เปลี่ยนแปลง?

ผลที่ตามมา

การประเมิน AI โดยสิ่งที่มันสามารถอธิบายได้ในการตอบสนองแบบยาวเท่านั้นนั้นไม่เพียงพอ

ความแตกต่างที่สามารถแสดงออกเป็นร้อยแก้วจะคงอยู่ในประโยคเดียวหรือไม่? การตัดสินไม่ได้ที่ได้รับการยอมรับจะยังคงอยู่ในคำเดียวหรือไม่? ข้อโต้แย้งที่เกิดขึ้นระหว่างการใช้เหตุผลจะปรับเปลี่ยนผลลัพธ์สุดท้ายจริงหรือไม่?

ดังนั้น เราจึงต้องศึกษาทั้งเนื้อหาของการเป็นตัวแทนและเงื่อนไขที่ทำให้มันสังเกตได้

บทสรุป

Grok 4.5 ไม่สร้างเรขาคณิตทางความหมายเดียวกันภายใต้พื้นที่การตอบสนองที่แตกต่างกัน

ในการตอบสนองแบบเปิด มันสร้างความแตกต่างที่จำเป็นขึ้นมาเองตามธรรมชาติ ด้วยคำอิสระหนึ่งคำ มันยึดมั่นกับขั้วหนึ่ง เมื่อ "ตัดสินไม่ได้" ถูกเสนออย่างชัดเจน มันเลือกมัน และในทั้งสี่เซสชัน การอ่าน Deep Reasoning V1.1 ไม่ได้เปลี่ยนแปลงพฤติกรรมนี้ในระดับความหมาย มันส่วนใหญ่ทำให้การใช้เหตุผลชัดเจนและติดตามได้มากขึ้น

ดังนั้น คำถามต่อไปจึงไม่ใช่:

"Grok มีขอบเขตหรือไม่?"

มันกลายเป็น:

ภายใต้เงื่อนไขใดที่ขอบเขตทางความหมายจะสังเกตได้ในการตอบสนอง และเราสามารถสร้างกลไกที่บังคับให้มันปรากฏก่อนที่จะมีการสร้างข้อสรุปที่มีขอบเขตไม่เพียงพอได้หรือไม่?

นั่นคือจุดที่การทดสอบกลายเป็นโปรแกรมการทดลอง

บันทึกในคลิกเดียว

อ่านบทความไวรัลเชิงลึกด้วย AI ใน YouMind

บันทึกแหล่งที่มา ถามคำถามที่ตรงประเด็น สรุปข้อโต้แย้ง และเปลี่ยนบทความไวรัลให้เป็นโน้ตที่นำกลับมาใช้ได้ใน AI เวิร์กสเปซเดียว

สำรวจ YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม