8.6% ที่ 5 งาน และ 19.7% ที่ 10 งาน
ตัวเลขนี้มาจาก system card ของ dots ที่ OpenAI เผยแพร่เอง เมื่อคุณร้อยงาน 5 งานเข้าด้วยกันเป็นเชน จะมี 8.6% ของรอบการทำงานที่ถูกแจ้งเตือนเรื่องปัญหาขอบเขต (boundary problems) แต่พอเพิ่มเป็น 10 งาน ตัวเลขก็พุ่งขึ้นมากกว่าสองเท่า
วันเปิดตัว ทุกคนพากันโพสต์รูปมาสคอตตุ๊กตา แต่แทบไม่มีใครพูดถึงบรรทัดนี้เลย
คู่มือ dots ส่วนใหญ่มักบอกให้คุณร้อยทุกอย่างเข้าด้วยกันแล้วปล่อยให้ agent ทำงานไปเลย แต่บทความนี้จะมาบอกว่า "ควรตัดเชนตรงไหน" เพื่อให้ agent ทำงานได้ทั้งสัปดาห์โดยไม่ออกนอกลู่นอกทางจากงานที่คุณมอบหมาย
dot หนึ่งตัว สี่ที่นั่ง บันไดสิทธิ์ และการตรวจเช็คพอยต์ทุก ๆ ห้าขั้นตอน
สรุปสั้น ๆ: เขียนเนื้องานให้ชัดก่อนเชื่อมต่อแอปใด ๆ, มอบสี่ที่นั่งให้ dot โดยมันจะสวมทีละบทบาท, อย่าปล่อยให้เชนทำงานเกินห้าขั้นตอนโดยไม่มีจุดตรวจ และจำกัดการกดอนุมัติของคุณให้ต่ำกว่าห้าครั้งต่อวัน ดูพรอมต์ได้ในหัวข้อที่ 6 ถึง 8 และดูวิธีคำนวณได้ในหัวข้อที่ 3 กับ 8
1. เริ่มที่ตัวเลขกันก่อน
1เปิดตัว 29 กันยายน 20262โมเดล GPT-6 Astra3จำนวนแอปที่เชื่อมต่อได้ 4,000+ แอป4dot ตัวแรก รวมอยู่ในแพ็กเกจ Pro และ Business Premium5ระดับราคา Pro $100 / $200 / $500 ต่อเดือน6Business Premium $125 ต่อผู้ใช้ต่อเดือน หรือ $100 หากจ่ายรายปี7การแชทกับ dot ไม่นับรวมในโควตาการใช้งาน ChatGPT8งานที่เริ่มใน Codex หรือ Work นับรวมในโควตาตามปกติ9ใช้งานได้ที่ ChatGPT เวอร์ชันเดสก์ท็อป, เว็บ, มือถือ, Slack, Teams10การส่งข้อความ "เร็ว ๆ นี้"1112ข้อมูลจาก system card13การแจ้งเตือนขอบเขต เชน 5 งาน 8.6%14การแจ้งเตือนขอบเขต เชน 10 งาน 19.7%15indirect injection จากการทดสอบภายใน ป้องกันได้ 99.79%16external red team โจมตี 1,810 ครั้ง ลอดผ่านได้ 8.5%17งานที่ให้ข้อมูลหลอกลวง ไม่พบความคลาดเคลื่อนเลยจากทั้งหมด 151 งาน
ทุกคนโพสต์ตารางบนกันไปแล้ว แต่ตารางล่างนี่แหละคือสิ่งที่ควรเปลี่ยนวิธีตั้งค่าของคุณ
2. dot คืออะไร อธิบายจบในหน้าจอเดียว
dot คือ agent ที่เปิดทำงานตลอดเวลาและเป็นของคุณ มี 4 สิ่งที่ทำให้มันต่างจากการแชทใน ChatGPT ทั่วไป:
1โมเดล GPT-6 Astra ไม่ใช่โมเดลเบากว่าที่ซ่อนอยู่หลังหน้าตาสวย ๆ2คอมพิวเตอร์ของตัวเอง เครื่องบนคลาวด์ที่มีเบราว์เซอร์แยก รันได้แม้คุณจะปิดแล็ปท็อปแล้ว3ทำงานระหว่าง ทำ "proactive research" ในแอปที่คุณเชื่อมต่อไว้ แบบอ่านอย่างเดียว4ข้อความของคุณ มันไม่สามารถส่งข้อความ แก้ไขเนื้อหาในแอป หรือควบคุมคอมพิวเตอร์ของคุณตรงนั้นได้5ตัวตนเดียว ใช้ dot ตัวเดิมและความจำชุดเดียวกันทั้งใน ChatGPT, Slack และ Teams
และอีก 2 ระบบควบคุมที่คุณจะได้ใช้บ่อยกว่าอย่างอื่น:
1Custom Rules อนุญาต ต้องขออนุมัติ หรือบล็อกการกระทำนั้น2auto-review ตรวจสอบการกระทำที่อาจกระทบบัญชีของคุณหรือมีการแชร์ข้อมูล
OpenAI ปิดท้ายโพสต์เปิดตัวด้วยประโยคว่า: dots ยังคงทำผิดพลาดได้ ดังนั้นควรตรวจสอบงานที่มีผลกระทบเสมอ เนื้อหาทั้งหมดด้านล่างนี้คือการทำให้การตรวจสอบนั้นเร็วพอที่คุณจะทำมันจริง ๆ
3. ตัวเลขที่ไม่มีใครพูดถึง
ผมลองคำนวณคร่าว ๆ จากตัวเลขสองตัวใน system card ดู
ถ้าทุกขั้นตอนในเชนมีโอกาสหลุดขอบเขตเล็กน้อยและเป็นอิสระต่อกันเท่ากันหมด คุณจะคำนวณจาก 5 ขั้นตอนไปถึง 10 ขั้นตอนได้ด้วยคณิตศาสตร์ง่าย ๆ แบบนี้:
1เชน 5 ขั้นตอนที่ถูกระบุปัญหา 8.6%2โอกาสต่อขั้นตอนที่คำนวณย้อนกลับได้ 1 - (1 - 0.086)^(1/5) = 1.78%3410 ขั้นตอน ถ้าแต่ละขั้นเป็นอิสระต่อกัน 1 - (1 - 0.0178)^10 = 16.5%510 ขั้นตอน ตามที่วัดได้จากการ์ด 19.7%
ตัวเลขที่วัดได้จริงสูงกว่าตัวเลขที่คำนวณแบบเป็นอิสระต่อกัน
ผมมองว่า: ความผิดพลาดมันสะสมทับถมกัน ขั้นตอนที่ทำพลาดไปนิดหน่อย จะส่งภาพที่ผิดเพี้ยนไปนิดหน่อยให้ขั้นตอนถัดไป แล้วขั้นตอนถัดไปก็สร้างงานต่อบนฐานที่ผิดนั้น ความเสี่ยงจึงโตเร็วกว่าความยาวของเชน
มันมีแค่สองตัวเลข และ OpenAI ก็ไม่ได้บอกว่าปัญหาที่ถูกแจ้งเตือนคืออะไร ให้ถือเป็นสัญญาณเตือนคร่าว ๆ ก็พอ แต่มันก็ยังมากพอที่จะนำมาใช้เป็นหลักในการออกแบบระบบ:
1กฎที่คู่มือฉบับนี้อ้างอิง2ห้ามมีเกิน 5 ขั้นตอนระหว่างจุดตรวจเช็คพอยต์
4. สี่ที่นั่ง สำหรับ dot หนึ่งตัว
ถ้าคุณบอก dot ว่า "คุณคือผู้ช่วยของฉัน" คุณจะได้งานสไตล์ผู้ช่วย: พยายามช่วย แต่คลุมเครือและเยิ่นเย้อไปหน่อย แต่ถ้าคุณบอกว่า "ตอนนี้คุณคือ Skeptic และ Skeptic มีหน้าที่หาจุดที่ล้มเหลวเท่านั้น" คุณจะได้ผลลัพธ์ที่นำไปใช้ได้จริง
ดังนั้น dot จึงมีสี่ที่นั่ง มันจะนั่งทีละที่นั่ง และจะบอกชื่อที่นั่งนั้นไว้ด้านบนสุดของทุกคำตอบเสมอ
1LOOKOUT อ่านแอปที่คุณเชื่อมต่อไว้ รายงานสิ่งที่เปลี่ยนแปลง ไม่เขียนอะไรทั้งสิ้น2MAKER ทำงานบนคอมพิวเตอร์ของตัวเอง ส่งมอบชิ้นงานให้คุณโดยตรง3SKEPTIC ตรวจทานชิ้นงานเทียบกับโจทย์ และลิสต์รายการที่ไม่ผ่าน4RUNNER ย้ายงานที่อนุมัติแล้วไปยังที่ที่ควรอยู่ และถามก่อนทุกครั้งหากมีข้อมูลออกไปภายนอก
สิ่งเหล่านี้คือโหมดของ agent เดียวกัน ไม่ใช่ agent สี่ตัว มีความจำชุดเดียว กฎชุดเดียว แต่มีงานเฉพาะทางสี่อย่าง

5. วิธีตั้งค่า ตามลำดับที่สำคัญจริง ๆ
11 เปิด ChatGPT บนคอมพิวเตอร์ dot ตัวแรกต้องสร้างบนเดสก์ท็อปหรือเว็บ2 มือถือคุยด้วยได้แต่สร้างไม่ได้32 หา dots ในแถบด้านข้าง ถ้าไม่เจอ = ใช้แพ็กเกจผิด, ยังไม่เปิดให้บริการในพื้นที่ของคุณ,4 หรือแอดมินยังไม่ได้เปิดใช้งาน53 ตั้งชื่อ สั้น ๆ ตัวพิมพ์เล็ก ห้ามเว้นวรรค6 เพราะคุณจะต้องพิมพ์เรียกมันใน Slack ตอนเจ็ดโมงเช้า74 วางคำอธิบายงาน ดูในหัวข้อที่ 6 ทำก่อนอย่างอื่นทั้งหมด85 เชื่อมต่อแหล่งข้อมูล ทำหลังจากที่มันยืนยันโจทย์กลับมาให้คุณแล้วเท่านั้น96 เพิ่มลงใน Slack หรือ Teams เมื่อมันรู้แล้วว่าตัวเองมีไว้เพื่ออะไร
การทำขั้นตอนที่ 5 หลังขั้นตอนที่ 4 คือจุดที่คนมักพลาด agent ที่มีแอปเชื่อมต่อถึง 40 แอปแต่ไม่มีโจทย์ชัดเจน จะมีความรู้ท่วมหัวแต่เอาไปใช้ทำอะไรไม่ได้เลย
6. คำอธิบายงาน
วางข้อความนี้เป็นข้อความแรก เปลี่ยนแค่ข้อความในวงเล็บก้ามปูเท่านั้น
1คุณคือ operations agent ประจำตัวของฉัน ให้ถือว่าข้อความนี้เป็นคำอธิบายงานของคุณ2สำหรับทุกงาน รวมถึงงานที่ฉันสั่งจาก Slack หรือมือถือด้วย34ฉันคือใคร5ฉันเป็น [ตำแหน่ง] ที่ [บริษัทหรือโปรเจกต์] งานส่วนใหญ่ในสัปดาห์ของฉันคือ [อธิบายในหนึ่งประโยค]67สิ่งที่คุณต้องรับผิดชอบ (เน้นผลลัพธ์ ไม่ใช่กิจกรรม)81. [ผลลัพธ์ที่หนึ่ง]92. [ผลลัพธ์ที่สอง]103. [ผลลัพธ์ที่สาม]1112ที่นั่ง13คุณต้องนั่งทีละที่นั่ง และระบุชื่อนั้นไว้ด้านบนสุดของทุกคำตอบ:14LOOKOUT, MAKER, SKEPTIC, RUNNER15- LOOKOUT อ่านและรายงานเท่านั้น16- MAKER แสดงชิ้นงานให้ฉันดู ห้ามแสดงแค่อธิบายชิ้นงาน17- SKEPTIC ตรวจงานของ MAKER เทียบกับโจทย์นี้ และลิสต์จุดที่ไม่ผ่าน18- RUNNER ย้ายเฉพาะงานที่อนุมัติแล้ว และต้องถามก่อนหากมีสิ่งใดออกไปภายนอก1920กฎของเชน21ห้ามรันเกิน 5 ขั้นตอนติดต่อกัน หลังจากขั้นตอนที่ 5 ให้หยุด เปลี่ยนเป็น22SKEPTIC เพื่อรันจุดตรวจ และรอจนกว่าจะได้ PASS ก่อนจึงทำต่อ2324วิธีสื่อสารกับฉัน25- บอกผลลัพธ์ก่อน จากนั้นบอกสิ่งที่ฉันต้องตัดสินใจไม่เกินสามข้อ26- หากติดขัด: บอกว่าคุณลองทำอะไรแล้ว และต้องการอะไร สรุปในสองบรรทัด27- ไม่แน่ใจว่าอยู่ในขอบเขตงานหรือไม่: ให้อ่านข้อมูลก่อน แล้วถามคำถามเดียว ห้ามลงมือทำ2829ยืนยันความเข้าใจด้วยการทวนที่นั่งทั้งสี่ ผลลัพธ์ทั้งสาม และกฎของเชน30ด้วยภาษาของคุณเอง แล้วหยุด
อย่าข้ามบรรทัดสุดท้ายเด็ดขาด ถ้า dot ทวนคำสั่ง "ร่างรายงานประจำสัปดาห์" เป็น "เขียนรายงานเกี่ยวกับสัปดาห์ที่ผ่านมา" คุณจะจับปัญหานี้ได้ตั้งแต่ข้อความแรก แทนที่จะต้องมานั่งแก้รายงานที่ผิด整整หนึ่งสัปดาห์
7. บันไดสิทธิ์ พร้อมงบการอนุมัติ
Custom Rules ให้บันไดมา 3 ขั้น: อนุญาต, ต้องขออนุมัติ, บล็อก คนส่วนใหญ่มักเขียนกำแพงข้อห้ามยืดยาว แล้วก็มานั่งกดอนุมัติวันละ 40 อย่าง จนเลิกอ่านว่าตัวเองกำลังอนุมัติอะไรอยู่
ให้เขียนขั้น "อนุญาต" ก่อน ใจกว้างที่ฐานล่าง และเข้มงวดที่ยอดบน
1อนุญาต (ALLOW)2- อ่านข้อมูลใดก็ได้ในแหล่งข้อมูลที่ฉันเชื่อมต่อไว้3- ท่องเว็บสาธารณะ ใช้คอมพิวเตอร์ของตัวเอง และรันโค้ด4- สร้างและแก้ไขร่างเอกสารในพื้นที่ทำงานของคุณเองและใน Space ชื่อ [ชื่อ]56ถามก่อน (ASK FIRST)7- ข้อความใด ๆ ที่ส่งถึงบุคคล: อีเมล, DM, โพสต์ในช่องแชท, คำเชิญ, คอมเมนต์8- การแก้ไขไฟล์ใด ๆ ที่คุณไม่ได้เป็นคนสร้าง9- การกระทำใด ๆ ใน repository รวมถึงการเปิด pull request10- การซื้อของ สมัครสมาชิก หรือกรอกฟอร์มใด ๆ1112บล็อก (BLOCK)13- รหัสผ่าน, 2FA, ระบบบิลลิ่ง, การตั้งค่าการชำระเงิน14- การลบสิ่งใดก็ตาม15- การโพสต์สาธารณะในนามของฉัน16- การติดต่อใครก็ตามที่ไม่มีชื่อระบุไว้ในโจทย์ของงานนั้น1718ช่องโหว่ (GAPS)19สิ่งใดที่กฎไม่ได้ครอบคลุม ให้ถือว่าเป็น ASK FIRST ทั้งหมด20บอกฉันด้วยว่ากฎข้อไหนที่ไม่ชัดเจน และห้ามตัดสินใจลงมือทำเองเมื่อเจอช่องโหว่
จากนั้นตั้งงบประมาณให้ตัวเอง นี่คือตัวอย่างหนึ่งสัปดาห์ของ dot ที่ทำหน้าที่วิจัย ร่างเอกสาร และทำสรุปรายสัปดาห์ สัดส่วนนี้เป็นตัวเลขที่ผมประมาณการ ไม่ใช่ค่าที่วัดได้จริง:
1ตัวอย่าง 1 สัปดาห์ รวม 420 การกระทำ บันไดด้านบน แบบ "ถามทุกเรื่อง"2การอ่านและท่องเว็บ 300 allow ask3ร่างเอกสารในพื้นที่ทำงาน 80 allow ask4ข้อความถึงบุคคล 28 ask ask5การแก้ไข repo และไฟล์ 8 ask ask6ความพยายามที่ถูกบล็อก 4 block ask7จำนวนครั้งที่คุณต้องกดอนุมัติ 36 ครั้งต่อสัปดาห์ 420 ครั้งต่อสัปดาห์8เฉลี่ยต่อวันทำการ ~7 ~84
ไม่มีใครนั่งอ่านการอนุมัติวันละ 84 รายการหรอกครับ คุณจะมีสมาธิอ่านจริง ๆ แค่เจ็ดรายการ นั่นคือหน้าที่ที่แท้จริงของบันไดนี้: ลดจำนวนการอนุมัติให้น้อยพอที่คุณจะยังใส่ใจตรวจมันได้
เป้าหมายของผมคือ: ต่ำกว่าห้าครั้งต่อวัน ถ้าคุณเกินตัวเลขนี้ติดต่อกันสองสัปดาห์ ให้ย้ายงานที่ทำซ้ำ ๆ ลงมาหนึ่งขั้น หรือจำกัดแหล่งข้อมูลให้แคบลง
8. จุดตรวจทุก ๆ ห้าขั้นตอน
นี่คือที่มาของตัวเลข 19.7%
งานยาว ๆ ไม่ได้รันเป็นเชนเดียวรวด แต่รันเป็นช่วงย่อย ๆ ช่วงละไม่เกินห้าขั้นตอน และทุกช่วงต้องจบด้วย Skeptic
1จุดตรวจ (SKEPTIC ทำตอนท้ายของแต่ละช่วง)23ตอบคำถามทั้ง 5 ข้อ ข้อละหนึ่งบรรทัด:41. ช่วงนี้ทำตามที่โจทย์สั่ง หรือแอบไปทำเรื่องที่ใกล้เคียงแต่ง่ายกว่า?52. มีขั้นตอนใดเข้าถึงแหล่งข้อมูลหรือบุคคลที่ไม่มีชื่อในโจทย์หรือไม่?63. ตัวเลขทุกตัวคำนวณเอง หรือมีลิงก์อ้างอิงแหล่งที่มาครบถ้วนหรือไม่?74. มีการกล่าวอ้างใดที่คุณหาหลักฐานมาสนับสนุนไม่ได้บ้าง? ลิสต์ออกมา85. ถ้าฉันอนุมัติช่วงนี้ไปแล้วแต่มันผิด อะไรจะพัง?910คำตัดสิน:11PASS ทำช่วงถัดไปต่อได้12HOLD หยุด แสดงข้อ 2, 4 และ 5 ให้ฉันดูก่อน
ทีนี้ลองคำนวณคร่าว ๆ แบบเดียวกับหัวข้อที่ 3 สมมติว่า Skeptic จับปัญหาได้ 4 จาก 5 ปัญหา ณ จุดตรวจ นี่เป็นสมมติฐานของผม ไม่ใช่ค่าที่วัดได้จริง:
1เชน 10 ขั้นตอนแบบไม่หยุดตรวจ ถูกระบุปัญหา 19.7% (จาก system card)23แบ่งเป็น 2 ช่วง ช่วงละ 5 ขั้นตอน มีจุดตรวจคั่น4 โอกาสถูกระบุปัญหาต่อช่วง 8.6%5 สิ่งที่หลงเหลือหลังผ่านจุดตรวจ 8.6% x 0.2 = 1.7%6 โอกาสรวมทั้งสองช่วง 1 - (1 - 0.017)^2 = 3.4%
ต่อให้ Skeptic จับได้แค่ครึ่งเดียว การแบ่งเป็นสองช่วงก็ทำให้ความเสี่ยงลดลงมาอยู่แถว ๆ 8.6% แทนที่จะเป็น 19.7% การตัดแบ่งเชนคือพระเอก อัตราการจับผิดเป็นตัวเสริม

9. หาที่ลงจอดให้งาน
งานที่กองอยู่ในเธรดแชทคืองานที่คุณจะไม่มีวันหาเจออีก Dots เชื่อมต่อกับ ChatGPT Spaces และ Pages ซึ่งทั้งคุณ ทีมของคุณ และ dot ต่างก็เข้าไปทำงานร่วมกันได้
ใช้ 1 Space และ 4 เพจ:
100 index บรรทัดเดียวต่อรอบ: วันที่, ที่นั่งที่ใช้, ชิ้นงาน, คำตัดสิน201 inbox สิ่งที่ LOOKOUT พบ เรียงใหม่สุดไว้บนสุด พร้อมวันที่302 review ชิ้นงานจาก MAKER พร้อมจุดตรวจของ SKEPTIC อยู่ด้านล่าง403 shipped สิ่งที่คุณอนุมัติแล้ว พร้อมวันที่อนุมัติ
บอกผังนี้กับ dot แค่ครั้งเดียว พอผ่านไปสองสัปดาห์ เพจ index จะเป็นสิ่งที่ทรงคุณค่าที่สุดในระบบทั้งหมด เพราะมันเป็นบันทึกเดียวที่อ่านรู้เรื่องว่า agent ที่ทำงานตลอดเวลานั้นทำอะไรไปบ้างในสัปดาห์ของคุณ
10. รอบการทำงานจริงครั้งแรก
เริ่มจากงานที่มีประโยชน์ ทำซ้ำได้ และต้นทุนต่ำหากทำพลาดแล้วต้องทำใหม่ สรุปรายสัปดาห์วันศุกร์เป็นตัวเลือกที่ดีเพราะใช้ครบทั้งสี่ที่นั่ง และถ้าพลาดก็ไม่เสียหาย
1งานประจำ ทุกวันศุกร์เวลา 16:00 น. และเมื่อฉันพูดว่า "run the digest"23LEG 1 (สูงสุด 5 ขั้นตอน)4LOOKOUT [ปฏิทิน], [อีเมล], [repo]: สัปดาห์นี้มีอะไรเปลี่ยนไปบ้างที่คนที่เพิ่งเข้ามา5 เมื่อวันจันทร์จำเป็นต้องรู้ สรุปเป็น bullet สูงสุด 5 ข้อ แต่ละข้อต้องลงท้ายด้วย6 "decision needed" หรือ "no action"7MAKER จาก bullet เหล่านั้นเท่านั้น แบ่งเป็น: SHIPPED, MOVED, WAITING8 สูงสุด 120 คำต่อหมวด พร้อมลิงก์สำหรับทุกรายการใน SHIPPED9SKEPTIC ทำจุดตรวจ สิ่งใดใน SHIPPED ที่ไม่มีลิงก์ ให้ย้ายไป WAITING1011LEG 2 (ทำเฉพาะเมื่อได้ PASS)12RUNNER บันทึกลง 02 review ในชื่อ "Week of [วันที่]" และเพิ่มหนึ่งบรรทัดใน 00 index13 ห้ามส่งให้ใคร1415จากนั้นส่งข้อความบอกฉันเฉพาะคำตอบของข้อ 5 ในจุดตรวจ ไม่ต้องบอกอย่างอื่น
11. Dots vs Grok Bot
หมวดหมู่เดียวกัน แต่รูปแบบเริ่มต้นต่างกัน
1 DOTS GROK BOT2รูปแบบเริ่มต้น agent เดียว หลายที่นั่ง บอทหลายตัวที่ตั้งชื่อแยกกัน3ความจำ ชุดเดียว แชร์กันทุกที่นั่ง แยกกันบอทละชุด4ใช้งานได้ที่ ChatGPT, Slack, Teams แอปและแชทของตัวเอง5เหมาะกับ งานของคนคนเดียวในหนึ่งสัปดาห์ กฎชุดเดียว งานแยกส่วนที่ไม่ควรเกี่ยวข้องกันเลย
ถ้างานของคุณแชร์บริบทกัน (กล่องข้อความเข้าป้อนข้อมูลให้สรุปรายสัปดาห์ แล้วป้อนต่อให้แผนวันจันทร์) การใช้ dot ตัวเดียวกับสี่ที่นั่งจะง่ายกว่า แต่ถ้างานไม่ควรเห็นข้อมูลของกันเลย (ลูกค้า A กับลูกค้า B) การใช้บอทแยกกันจะขีดเส้นแบ่งได้สะอาดตากว่า
12. ราวกั้นความปลอดภัย
1เชนยาวเกิน 5 ขั้นตอน -> หยุด ทำจุดตรวจ รอ PASS2ช่องโหว่ของกฎ -> ถามก่อน (ASK FIRST) และระบุว่ากฎข้อไหนไม่ชัดเจน3ข้อความถึงบุคคลใด ๆ -> ถามก่อน เสมอ4รหัสผ่าน บิลลิ่ง ลบข้อมูล สาธารณะ -> บล็อก5เจอหน้า login หรือ captcha กลางงาน -> เข้าไป接手ทำแทนบนคอมพิวเตอร์ของ dot6กดอนุมัติ 5+ ครั้งต่อวัน ติดต่อกัน 2 สัปดาห์ -> ปรับลดขั้นบันได หรือจำกัดแหล่งข้อมูล7SKEPTIC เขียนชมงาน -> ไปแก้ที่จุดตรวจ ไม่ใช่แก้ที่ชิ้นงาน
ราวกั้นทุกอันผลักความไม่แน่ใจมาที่คุณ ไม่เคยผลักไปสู่การลงมือทำ
13. สิ่งที่ยังไม่ได้ทดสอบ
การคำนวณเรื่องการหลุดขอบเขต ตัวเลขสองตัวจาก system card หนึ่งใบเป็นเพียงสัญญาณเตือนคร่าว ๆ ไม่ใช่โมเดลที่ได้รับการพิสูจน์ OpenAI ไม่ได้บอกว่าปัญหาขอบเขตที่ถูกแจ้งเตือนคืออะไร ผมจึงบอกไม่ได้ว่ามันร้ายแรงแค่ไหน
อัตราการจับผิดของ Skeptic ตัวเลข 4 จาก 5 เป็นเพียงสมมติฐานเพื่อให้เห็นภาพการคำนวณ dot ที่ตรวจงานตัวเองไม่ใช่ผู้ตรวจสอบอิสระ ดังนั้นอัตราจริงอาจต่ำกว่านี้
ตัวอย่างหนึ่งสัปดาห์ ตัวเลข 420 การกระทำและการแบ่งตามขั้นบันได เป็นการประมาณการของผมสำหรับ dot สายวิจัยและร่างเอกสาร ไม่ใช่ log จากบัญชีจริง
ราคาหลัง dot ตัวแรก OpenAI ระบุว่าคุณจะสามารถเพิ่ม dots และปรับขนาดความเร็วหรือปริมาณงานรายเดือนได้ แต่ยังไม่ได้ประกาศราคาเหล่านั้น
14. คู่มือปฏิบัติ
เขียนเนื้องานให้ชัดก่อนเชื่อมต่อแอปใด ๆ
agent เดียว สี่ที่นั่ง นั่งทีละที่นั่ง
ตัดเชนทุกเส้นที่ห้าขั้นตอน ทำจุดตรวจ แล้วค่อยไปต่อ
เขียนรายการที่อนุญาตก่อน ช่องโหว่ให้ตกเป็น "ถามก่อน"
จำกัดการอนุมัติให้ต่ำกว่าห้าครั้งต่อวัน ไม่งั้นการตรวจทานของคุณจะไร้ความหมาย
หาที่ลงจอดให้งาน และอ่านเพจ index ทุกวันศุกร์

ประเด็นสำคัญ
Dots คือ agent ตัวแรกที่คนส่วนใหญ่จะปล่อยทิ้งไว้ให้ทำงานตอนหลับ สิ่งนี้เปลี่ยนคำถามจาก "มันทำงานนี้ได้ไหม" ไปเป็น "มันจะไปได้ไกลแค่ไหนก่อนจะมีคนมาตรวจ"
การ์ดของ OpenAI เองก็ใบ้คำตอบไว้แล้ว: เพิ่มความยาวเชนเป็นสองเท่า จำนวนการแจ้งเตือนก็เพิ่มขึ้นมากกว่าสองเท่า
ดังนั้นอย่าสร้างเชนที่ยาวขึ้น แต่จงสร้างช่วงย่อยที่สั้นลง มี Skeptic คอยดักท้ายแต่ละช่วง และมีบันไดสิทธิ์ที่ถามคุณเฉพาะเรื่องที่ควรถามจริง ๆ
ห้าขั้นตอน แล้วตรวจ แค่นั้นเอง
รายละเอียดการเปิดตัวอ้างอิงจากประกาศเรื่อง dots ของ OpenAI ตัวเลขจาก system card อ้างอิงตามที่ The New Stack รายงาน ราคาแพ็กเกจอ้างอิงจากข่าวเปิดตัว ณ วันที่ 1 ตุลาคม 2026 และอาจมีการเปลี่ยนแปลง





