YouMind
ลงชื่อเข้าใช้

Opus 4.8: ราคาเท่าเดิม แต่ได้ประสิทธิภาพเพิ่มเป็นสองเท่า

@shmidtqq
อังกฤษ30 พ.ค. 2569
1.2M
215
18
33
516

TL;DR

Opus 4.8 จาก Anthropic มาพร้อมกับการอัปเกรดการทำงานที่สำคัญ รวมถึงการควบคุม effort และเวิร์กโฟลว์แบบไดนามิก แม้ว่าผลการทดสอบประสิทธิภาพจะเพิ่มขึ้นเพียงเล็กน้อย แต่คุณค่าที่แท้จริงอยู่ที่การปรับการใช้โทเค็นและความเร็วให้เหมาะสมสำหรับงานเขียนโค้ดที่ซับซ้อน

ราคาเท่าเดิม คนส่วนใหญ่จะแค่สลับโมเดลแล้วพลาดทุกอย่างที่เหลือ

shmidt - inline image

พร้อมกับ Opus 4.8 Anthropic ได้เปิดตัวสามฟีเจอร์ที่เปลี่ยนวิธีทำงานใน Claude Code มากกว่าตัวเลข benchmark: effort control, dynamic workflows และ fast mode ที่ถูกกว่า คนที่ตั้งค่าสิ่งเหล่านี้อย่างเหมาะสมจะได้ผลลัพธ์ที่ดีกว่าและใช้จ่ายน้อยกว่า นี่คือรายละเอียด

ตัวเลขเดียวที่สำคัญที่สุด

ไม่ใช่ 69.2% ในการเขียนโค้ด แต่คือ 4.8 มีโอกาสปล่อยให้ข้อบกพร่องหลุดรอดในโค้ดที่มันเขียนเองน้อยลงประมาณ 4 เท่า

โมเดลเก่าชอบพูดอย่างมั่นใจว่า "เสร็จแล้ว แก้บั๊กแล้ว" โดยมีหลักฐานบางๆ Anthropic เน้นความซื่อสัตย์: 4.8 ช้าลงบ่อยขึ้นและแจ้งจุดที่มันไม่แน่ใจ แทนที่จะสร้างโค้ดที่ดูสมเหตุสมผลแต่ทำให้เคสขอบเสียหายอย่างเงียบๆ ตลอดเซสชันยาวๆ สิ่งนี้สะสม โมเดลที่ยอมรับความไม่แน่นอนในเทิร์นที่ 15 ช่วยให้คุณประหยัดเวลาดีบักไปสองสามชั่วโมงในเทิร์นที่ 40

สิ่งที่เปลี่ยนไป: เวอร์ชันสั้น

การเขียนโค้ด

SWE-bench Verified: 87.6% → 88.6% (ใกล้เพดาน)

SWE-bench Pro (ยากกว่า ปนเปื้อนน้อยกว่า): 64.3% → 69.2% นำ GPT-5.5 มากกว่า 10 จุด

นี่คือตัวเลขการเขียนโค้ดหลัก

เทอร์มินัล

Terminal-Bench 2.1: 66.1% → 74.6% (+8.5) แต่ GPT-5.5 ยังนำ (78.2%) หนึ่งในเจ็ด benchmark ที่ 4.8 แพ้

งานความรู้

GDPval-AA: 1890 Elo เทียบกับ 1769 ของ GPT-5.5 ช่องว่างที่กว้างที่สุดในตารางทั้งหมด

การใช้คอมพิวเตอร์

OSWorld-Verified: 83.4% (ส่วนหนึ่งของกำไรมาจาก harness ที่อัปเดต ซึ่ง Anthropic ระบุอย่างเปิดเผย)

วิทยาศาสตร์

GPQA Diamond: 93.6% แบนโดยพื้นฐาน (ทั้งสองโมเดลอยู่เหนือ 93% นั่นคือการอิ่มตัว ไม่ใช่การถดถอย)

shmidt - inline image

Anthropic เองเรียกการเปิดตัวครั้งนี้ว่า "การปรับปรุงที่เล็กน้อยแต่จับต้องได้" benchmark เป็นบวก การเปลี่ยนแปลงเชิงปฏิบัติการด้านล่างคือเรื่องจริง

ฟีเจอร์ 1. การควบคุมความพยายาม (ที่ถูกประเมินต่ำที่สุด)

Opus 4.8 ตั้งค่าเริ่มต้นเป็น High effort แต่ตอนนี้คุณตัดสินใจว่ามันใช้ความคิดมากแค่ไหนในงานหนึ่งๆ คิดว่ามันเป็นเกียร์ธรรมดาสำหรับการใช้เหตุผล

ใน claude.ai และ Cowork แถบเลื่อนอยู่ถัดจากตัวเลือกโมเดล มีห้าระดับ: ต่ำ ปานกลาง สูง (ค่าเริ่มต้น) พิเศษ สูงสุด พร้อมสวิตช์การคิดแยกต่างหาก ใน Claude Code เป็นระดับเดียวกันแต่ชื่อต่างกันเล็กน้อย และมีโหมดอัตโนมัติ:

หมายเหตุ: "Extra" ใน claude.ai และ xhigh ใน Claude Code เป็นระดับเดียวกัน แค่ป้ายชื่อต่างกันในพื้นผิวที่ต่างกัน

shmidt - inline image

ส่วนเรื่องเงิน เพื่อไม่ให้สับสน ไม่มีค่าธรรมเนียมเพิ่มแยกตามระดับความพยายาม อัตราเท่ากันทุกระดับ: $5 ต่อ 1M input tokens, $25 ต่อ 1M output ความแตกต่างไม่ใช่ราคาต่อ token แต่เป็นจำนวน token ที่โมเดลใช้ ต่ำตอบสั้นและคิดน้อย สูงสุดคิดนานและใช้ token มากกว่าหลายเท่า ดังนั้นสูงสุด "แพงกว่า" เพราะปริมาณ ไม่ใช่เพราะอัตรา

แนวทางคร่าวๆ สำหรับการใช้จ่ายสัมพัทธ์ในงานเดียวกัน (ตัวเลขเป็นตัวอย่าง เพื่อให้เข้าใจโดยสัญชาตญาณ):

ตัวอย่างเรื่องเงิน สมมติว่าคำตอบแบบสูงมีค่าใช้จ่าย ~$0.05 คำขอเดียวกันที่ระดับต่ำอยู่ที่ ~$0.005 และที่ระดับสูงสุดอาจถึง ~$0.20-0.40 หาก 60% ของ prompt ของคุณเป็นเรื่องเล็ก ("ฟังก์ชันนี้คืนค่าอะไร?") การย้ายจากสูงเป็นต่ำจะลดค่าใช้จ่ายรายวันหลายเท่า โดยไม่มีผลกระทบด้านคุณภาพในจุดที่สำคัญ

ทำไมสิ่งนี้ถึงกระทบเงินในกระเป๋ามากที่สุด คนส่วนใหญ่จะปล่อยทุกอย่างไว้ที่สูง (หรือเร่งเป็นสูงสุด "เพื่อความปลอดภัย") และไม่แตะแถบเลื่อน คนที่จัดเส้นทางความพยายามตามงานจะได้ผลลัพธ์เดียวกันในราคาที่ถูกกว่าอย่างเห็นได้ชัด นั่นคือฟีเจอร์ที่ถูกประเมินต่ำที่สุดในการเปิดตัวครั้งนี้

ฟีเจอร์ 2. โหมดเร็ว (ถูกกว่า 3 เท่า)

โหมดเร็วรัน Opus ด้วยความเร็ว 2.5 เท่าด้วยคุณภาพเดียวกัน และตอนนี้ถูกกว่าก่อน 3 เท่า

เปิด/ปิดใน Claude Code ด้วย /fast (เซสชันที่ใช้งานอยู่จะถูกทำเครื่องหมายด้วยไอคอน ↯) การเข้าถึง API ถูกจำกัดในตอนนี้ (รอคิวที่ claude.com/fast-mode)

ใช้โหมดเร็วสำหรับ: การรีแฟคเตอร์หลายไฟล์ขนาดใหญ่ การสร้างโค้ดจากสเปค เอกสารประกอบ การสร้างเทส ทุกที่ที่ความเร็วชนะความลึก ใช้โหมดมาตรฐานสำหรับ: การดีบักซับซ้อน การตัดสินใจทางสถาปัตยกรรม การตรวจสอบความปลอดภัย ทุกที่ที่คุณภาพการคิดชนะความเร็ว

ฟีเจอร์ 3. เวิร์กโฟลว์แบบไดนามิก (เรื่องใหญ่)

ตอนนี้ Claude Code เขียนสคริปต์ orchestration เป็น JavaScript สำหรับงานของคุณและรันในพื้นหลังในขณะที่เซสชันของคุณยังตอบสนองได้ แผนอยู่ในโค้ด ไม่ใช่บริบทของโมเดล ดังนั้นเฉพาะคำตอบสุดท้ายที่กลับมาที่เซสชันของคุณ

สิ่งที่ควรรู้ จากเอกสารทางการ:

  • สูงสุด 16 subagents พร้อมกัน เพดานสูงสุด 1,000 ต่อการรัน
  • สามารถดำเนินต่อได้: หากแล็ปท็อปดับหรือคุณปิดเทอร์มินัล การรันจะเริ่มต่อจากจุดที่หยุด
  • ต้องใช้ Claude Code v2.1.154+ รุ่นวิจัย
  • เปิดโดยค่าเริ่มต้นบน Max, Team, Enterprise บน Pro เปิดใน /config (และสลับไปที่ Opus 4.8 ก่อน)
  • Subagents ทำงานในโหมด acceptEdits และสืบทอด allowlist เครื่องมือของคุณ

เรียกใช้ด้วย /effort ultracode (การตั้งค่า Claude Code: xhigh บวกการ orchestration เวิร์กโฟลว์อัตโนมัติ) หรือเพียงแค่อธิบายงานใหญ่เป็นคำพูด:

shmidt - inline image

เหมาะสำหรับ: การย้ายระบบข้าม 200+ ไฟล์ การตรวจสอบความปลอดภัยทั้ง codebase การสร้างเทสทั้งโปรเจกต์ การรีแฟคเตอร์ขนาดใหญ่ การวิจัยข้ามหลาย repos

ไม่เหมาะสำหรับ: การแก้บั๊กง่ายๆ การแก้ไขไฟล์เดียว คำถามสั้นๆ มากเกินไป

เรื่องค่าใช้จ่าย เวิร์กโฟลว์ใช้ token มากกว่าเซสชันปกติอย่างมีนัยสำคัญ วิธีทางการในการควบคุมค่าใช้จ่ายคือการจำกัดขอบเขตงาน: รันการตรวจสอบในโฟลเดอร์เดียวก่อน ดูว่ามันสร้าง subagents กี่ตัว จากนั้นปรับเทียบการรันใหญ่จากตรงนั้น

เพื่อปิดการใช้งานเวิร์กโฟลว์ทั้งหมด:

ตัวอย่างการกำหนดค่า Claude Code (เทมเพลตเริ่มต้น)

ตัวแปรสภาพแวดล้อม (ใน ~/.zshrc หรือ ~/.bashrc):

จากนั้นส่วนที่มีประโยชน์: settings.json ที่มีสิทธิ์ปลอดภัย มันให้โมเดลอ่านและแก้ไขโค้ด รันเทส และ commit แต่บล็อกสิ่งอันตรายอย่างเด็ดขาด: การอ่าน .env และ SSH keys, rm -rf, sudo, และ git push เอเจนต์ทำงานได้อย่างอิสระแต่ไม่สามารถทำลายอะไรหรือรั่วไหลอะไรได้

shmidt - inline image

ไฟล์ settings.json ที่พร้อมวางได้อยู่ในช่อง Telegram ของฉัน (รูปแบบใหญ่เกินไปที่จะอ่านชัดๆ ที่นี่): t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

สรุปคำสั่งประจำวัน

การติดตั้ง Opus 4.8: สามวิธี

A. เบราว์เซอร์หรือแอป บน claude.ai เลือก Claude Opus 4.8 ในรายการโมเดลและตั้งค่าแถบเลื่อนความพยายาม ไม่ต้องติดตั้ง

B. API รหัสโมเดล claude-opus-4-8 ราคา $5/$25 ต่อ 1M บริบทสูงถึง 1M (200k บน Microsoft Foundry) เอาต์พุตสูงถึง 128k การคิดแบบขยายด้วยงบประมาณคงที่ไม่รองรับ: ใช้ adaptive thinking (thinking: {type: "adaptive"}) และพารามิเตอร์ effort

C. Claude Code (เทอร์มินัล) ตัวติดตั้งแบบเนทีฟเป็นวิธีการที่แนะนำในขณะนี้ (npm เป็นรุ่นเก่า):

จากนั้นรัน claude ลงชื่อเข้าใช้ผ่านเบราว์เซอร์ และเลือก Opus 4.8 ด้วย /model

รายการตรวจสอบการย้าย: 4.7 ถึง 4.8

  • เปลี่ยนรหัสโมเดลเป็น claude-opus-4-8
  • รัน 10-20 งานจริงของคุณบน 4.7 และ 4.8 ด้วย prompt ที่เหมือนกัน
  • เปรียบเทียบ: อัตราการเสร็จสิ้น จำนวนขั้นตอน token อัตราการผ่านเทส
  • ตรวจสอบ prompt ที่ปรับแต่งสำหรับพฤติกรรมของ 4.7
  • กำหนดระดับความพยายามตามประเภทงาน
  • ทดสอบโหมดเร็วในที่ที่ความเร็วสำคัญ
  • อัปเดต Claude Code เป็น v2.1.154+ (สำหรับเวิร์กโฟลว์)
  • ตรวจสอบบิล API อีกครั้งหลังจากสัปดาห์แรก

บัตรบันทึก: ทุกอย่างในที่เดียว

รุ่น: claude-opus-4-8 · เปิดตัว 2026-05-28

ราคา: $5 / $25 ต่อ 1M · โหมดเร็ว $10 / $50

บริบท: สูงสุด 1M · เอาต์พุตสูงสุด 128k

สำคัญ: SWE-bench Pro 64.3% → 69.2% (+10 เหนือ GPT-5.5) · SWE-bench Verified 88.6% · บั๊กที่พลาดน้อยลง 4 เท่า · GDPval-AA 1890 Elo

ใหม่: การควบคุมความพยายาม · โหมดเร็วถูกกว่า 3 เท่า · เวิร์กโฟลว์แบบไดนามิก (16 พร้อมกัน / 1,000 ต่อการรัน)

ขอบคุณที่อ่าน หากคุณเลือกสิ่งหนึ่งจากนี้ ให้เป็น "จัดเส้นทางความพยายามตามงาน"

บันทึกที่เหลือของฉันเกี่ยวกับ Claude และการเขียนโค้ดแบบ vibe อยู่ที่นี่: t.me/+JmDeelv5UCwwMTcy

แล้วพบกันที่นั่น

@shmidtqq.

บันทึกในคลิกเดียว

อ่านบทความไวรัลเชิงลึกด้วย AI ใน YouMind

บันทึกแหล่งที่มา ถามคำถามที่ตรงประเด็น สรุปข้อโต้แย้ง และเปลี่ยนบทความไวรัลให้เป็นโน้ตที่นำกลับมาใช้ได้ใน AI เวิร์กสเปซเดียว

สำรวจ YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม