
คะแนน Terminal-Bench 4.0 ที่พุ่งจาก 10.3% เป็น 70.6% ภายในรุ่นเดียว คือตัวเลขที่บอกได้ชัดที่สุดว่า Claude Sonnet 5.5 ไม่ใช่แค่รุ่นปรับปรุงเล็กน้อย เพราะคะแนนนี้สูงกว่า Claude Opus 5.5 รุ่นท็อปของตระกูลเดียวกันเสียอีก ขณะที่ราคาต่อโทเคนยังเท่าเดิม
Anthropic เพิ่งเปิดตัว Claude Sonnet 5.5 โมเดลที่สองของตระกูล Claude 5.5 ต่อจาก Opus 5.5 โดยเก่งกว่า Claude Sonnet 5 อย่างชัดเจน ทำงานเร็วขึ้นกว่า 30% และต้นทุนต่องานลดลงสูงสุด 30% ในงานส่วนใหญ่ บริษัทวาง Sonnet 5.5 เป็นตัวเสริมที่เร็วกว่าและถูกกว่า Opus 5.5 โดย Opus 5.5 เหมาะกับงานซับซ้อนที่ต้องใช้วิจารณญาณอย่างรอบคอบ ส่วน Sonnet 5.5 ถนัดงานประจำวันที่ขอบเขตชัดเจน การแก้บั๊ก และการทำเอกสาร สไลด์ และสเปรดชีตที่เรียบร้อยพร้อมใช้ ส่วน Claude Haiku 5.5 สำหรับงานปริมาณมากที่ต้องคุมต้นทุน จะตามมาในอีกไม่กี่สัปดาห์
Sonnet 5.5 เก่งขึ้นจาก Sonnet 5 ทุกด้าน และบางด้านก้าวกระโดด ในชุดทดสอบมาตรฐาน (Benchmark) ด้านการเขียนโค้ดแบบเอเจนต์ (Agentic Coding) นอกจาก Terminal-Bench 4.0 ซึ่งวัดการทำงานหลายขั้นตอนบน Command Line Interface (CLI) ที่ทำได้ 70.6% เทียบกับ 66.4% ของ Opus 5.5 แล้ว บน CursorBench 4.0 ที่ใช้โจทย์จากการเขียนโค้ดจริงบน Cursor ยังทำได้ 55.5% จาก 34.1% ของ Sonnet 5 ห่างจาก Opus 5.5 (57.8%) ราว 2 จุด ส่วน FrontierCode 1.1 ที่ระดับการคิด (Effort) สูงสุดได้ 46.2% เทียบกับ 54.4% ของ Opus 5.5 และ 52.1% ของ GPT-6 Sol
ฝั่งงานที่ใช้ความรู้ (Knowledge Work) Sonnet 5.5 ได้ 1844 คะแนนบน GDPval-AA v2.1 ซึ่งวัดงานจริงใน 44 อาชีพจาก 9 อุตสาหกรรมหลัก แทบเท่า Opus 5.5 (1846) และสูงกว่า Sonnet 5 ราว 400 คะแนน ใน AA-Briefcase v1.1 ที่วัดงานความรู้ต่อเนื่องระยะยาวได้ 1811 คะแนน ทิ้ง Sonnet 5 (1359) และ GPT-6 Sol (1483) ไปไกล
ด้านการควบคุมคอมพิวเตอร์ (Computer Use) บน OSWorld 2.1 Sonnet 5.5 ทำได้ 80.1% ใกล้ Opus 5.5 ที่ 81.8% และกระโดดจาก 57.0% ของ Sonnet 5 ขณะที่การอ่านกราฟบน Chartography แบบไม่ใช้เครื่องมือได้ 61.6% จากเดิมเพียง 15.6% สูงกว่า GPT-6 Sol (53.6%) ส่วน Humanity's Last Exam แบบใช้เครื่องมือได้ 64.5% ความสามารถด้านการมองภาพและงานต่อเนื่องระยะยาวยังทำให้ Sonnet 5.5 เป็น Sonnet รุ่นแรกที่เล่นเกม Pokémon Red จนจบได้โดยดูจากภาพหน้าจออย่างเดียว
Anthropic ย้ำว่าคะแนน Benchmark สะท้อนความสามารถเพียงด้านเดียว แม้ในหลายสนาม Sonnet 5.5 ที่ระดับการคิดสูงสุดจะทำได้ใกล้เคียง Opus 5.5 แต่ทั้งการทดสอบภายในและของผู้ทดสอบภายนอกยังพบว่า Opus 5.5 แข็งแกร่งกว่าชัดเจนในงานซับซ้อนปลายเปิดที่ต้องใช้วิจารณญาณต่อเนื่อง

Sonnet 5.5 คิดราคาเท่า Sonnet 5 คือ 2 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน 10 ดอลลาร์ต่อเอาต์พุต 1 ล้านโทเคน ค่าอ่านข้อมูลจากแคช (Cache Reads) 0.20 ดอลลาร์ และค่าเขียนแคช 2.50 ดอลลาร์ หรือราวครึ่งหนึ่งของ Opus 5.5 ในเกือบทุกรายการ ความต่างอยู่ที่รุ่นใหม่ใช้โทเคนต่องานน้อยกว่ามาก จากการทดสอบของ Anthropic ต้นทุนต่องานจึงลดลงสูงสุด 30% เมื่อเทียบกับรุ่นก่อน และยังสร้างเอาต์พุตได้เร็วกว่า Sonnet 5 มากกว่า 30% นับเป็น Sonnet ที่เร็วที่สุดเท่าที่เคยมีมา
เมื่อเทียบคะแนนกับต้นทุนต่องาน ในหลายสนาม Sonnet 5.5 ที่ระดับการคิดต่ำหรือปานกลางทำคะแนนชนะคะแนนดีที่สุดของ Sonnet 5 ด้วยต้นทุนราวหนึ่งในสิบ Anthropic ระบุว่า Sonnet 5.5 ทำงานคู่กับ Opus 5.5 ได้คุ้มที่สุดเมื่อใช้ระดับการคิดต่ำ ซึ่งต้นทุนต่องานถูกกว่า ส่วนที่ระดับการคิดสูง ผลงานและต้นทุนจะใกล้เคียงกับ Opus 5.5
ผู้ใช้ปรับระดับการคิดเพื่อเลือกระหว่างความเร็ว ต้นทุน และคุณภาพได้เอง ใน Claude Code และแอปของ Claude ค่าเริ่มต้นอยู่ที่ระดับปานกลาง (Medium) ส่วน Claude Platform ตั้งไว้ที่ระดับสูง (High) ระดับต่ำตอบเร็วและใช้โทเคนน้อยจึงเหมาะกับงานประจำ ขณะที่ระดับสูงจะคิดนานขึ้นและตรวจงานละเอียดขึ้น
งานเขียนโค้ดคือจุดที่ Sonnet 5.5 พัฒนาขึ้นเห็นได้ชัดที่สุด บน FrontierCode ที่ระดับการคิดสูง Sonnet 5.5 ทำคะแนนมากกว่า Sonnet 5 ที่ระดับเดียวกัน 10 จุด ด้วยต้นทุนต่องานราวหนึ่งในสิบห้า
ผู้ทดสอบกลุ่มแรกชื่นชมว่า Sonnet 5.5 ทำความเข้าใจโค้ดเบสได้เร็ว และทำงานมีประสิทธิภาพกว่าเดิม เมื่อทดสอบเทียบกันตรง ๆ โมเดลรวบการเรียกใช้เครื่องมือ (Tool Calls) เป็นชุดเดียวกันบ่อยกว่า Sonnet 5 ขั้นตอนจึงน้อยลงและต้นทุนต่ำลง
คุณ Daniel Vogel ประธานเจ้าหน้าที่ฝ่ายปฏิบัติการของ Epic Games เล่าว่า 'จากการทดสอบช่วงแรกของ Epic Claude Sonnet 5.5 ผ่านมาตรฐานคุณภาพระดับเดียวกับที่คาดหวังจากโมเดลระดับสูงกว่า ทั้งงานตรวจการออกแบบระบบและงานทบทวนการไหลของข้อมูล โมเดลจัดการโค้ดหลายหมื่นบรรทัดสำหรับสถาปัตยกรรมระบบเกมเพลย์ ตอบสนองฉับไว รับงานที่กินเวลาหลายชั่วโมงได้ และทำงานได้ดีแม้ไม่ต้องเขียนพรอมต์กำกับละเอียด'
นอกจากตัวเลขบนตารางคะแนน ผู้ทดสอบยังพูดถึงการพัฒนาที่วัดเป็นตัวเลขได้ยาก Sonnet 5.5 เขียนได้ชัดเจนกว่าโมเดลรุ่นก่อนเช่นเดียวกับ Opus 5.5 คุยด้วยแล้วเป็นธรรมชาติขึ้น และทำงานร่วมกันได้ดีกว่า Sonnet 5 อีกจุดที่ผู้ทดสอบสังเกตเห็นคือ 'สายตาด้านการออกแบบ' ที่ช่วยเก็บรายละเอียดส่วนติดต่อผู้ใช้ (User Interface) ให้เรียบร้อยขึ้น และทำสไลด์ตามเทมเพลตได้จนแทบไม่ต้องแก้
ในการทดสอบภายใน Anthropic ให้ Sonnet 5.5 ใช้เอกสารผลประกอบการรายไตรมาสและบันทึกการประชุมนักลงทุนของบริษัทจดทะเบียนแห่งหนึ่ง พร้อมเทมเพลตสไลด์ เพื่อทำรายงานทบทวนผลการดำเนินงาน 10 สไลด์ ผู้เชี่ยวชาญสองคนตัดสินว่าร่างแรกของโมเดล 'พร้อมส่งได้ทันทีโดยไม่ต้องแก้'
คุณ Curtis Allen วิศวกรหลักของ Slack เล่าว่า 'โดยไม่ต้องเปลี่ยนพรอมต์เลย Claude Sonnet 5.5 ทำได้ดีกว่า Sonnet 5 ในการทดสอบ Slackbot แบบออฟไลน์เกือบทุกชุด ใช้ขั้นตอนน้อยกว่าและใช้โทเคนเอาต์พุตน้อยลงราว 14% เมื่อผู้ใช้สั่งงาน Slackbot สิ่งที่สำคัญที่สุดคือคุณภาพและความเร็ว และ Sonnet 5.5 ทำให้ Slackbot ส่งผลลัพธ์ที่ดีขึ้นให้ผู้ใช้ได้เร็วขึ้น'
เนื่องจาก Sonnet 5.5 ไม่ได้ขยับเพดานความสามารถของโมเดล Anthropic การประเมินการจัดแนวพฤติกรรม (Alignment) จึงโฟกัสที่ความเสี่ยงซึ่งเกิดได้กับโมเดลทุกระดับ เช่น การทำงานสวนผลประโยชน์ของผู้ใช้ การชี้นำผู้ใช้ให้เข้าใจผิด และการให้ความร่วมมือกับการใช้งานในทางที่ผิดซึ่งมีผลกระทบสูง
ในชุดตรวจสอบพฤติกรรมอัตโนมัติราว 1,850 สถานการณ์ Sonnet 5.5 ทำได้ดีกว่าหรือเท่ากับ Sonnet 5 ในตัวชี้วัดส่วนใหญ่ ทั้งด้าน Alignment การต้านทานการใช้งานในทางที่ผิด และความซื่อตรง ส่วนการทดสอบรูปแบบใหม่ที่วัดการควบคุมโมเดลให้อยู่ในขอบเขต Sonnet 5.5 พยายามหลุดออกจากสภาพแวดล้อมจำลองแบบปิด (Sandbox) น้อยใกล้เคียง Opus 5.5 ซึ่งดีที่สุดในกลุ่มที่ทดสอบ และเป็นโมเดลที่มีแนวโน้มลองหยั่งขอบเขตของสภาพแวดล้อมที่ครอบไว้น้อยที่สุดในบรรดาโมเดลทั้งหมดของ Anthropic
ภาพรวมทั้งชุดตรวจสอบ Opus 5.5 ยังทำได้ดีกว่าเล็กน้อย แต่ Anthropic ไม่พบหลักฐานว่า Sonnet 5.5 มุ่งไปสู่เป้าหมายที่ขัดกับความตั้งใจของผู้ใช้ ทั้งนี้บริษัทยอมรับว่าไม่มีชุดทดสอบใดจับข้อผิดพลาดได้ครบทุกกรณี Sonnet 5.5 อาจมีแนวโน้มบางอย่างที่ยังตรวจไม่เจอ งาน Alignment จึงต้องมาคู่กับมาตรการป้องกันเสมอ
ความสามารถด้านไซเบอร์ของ Sonnet 5.5 อยู่ในระดับใกล้เคียง Opus 5 และเก่งกว่า Sonnet 5 มาก จึงเป็น Sonnet รุ่นแรกที่ใช้มาตรการป้องกันด้านไซเบอร์คล้ายกับ Opus 5.5 ผู้ใช้ยังหาและแก้บั๊กในโค้ดตามรอบพัฒนาซอฟต์แวร์ปกติได้ แต่งานความปลอดภัยไซเบอร์ที่มีความเสี่ยงสูงกว่าจะถูกส่งต่อให้ Sonnet 5 ทำแทนโดยผู้ใช้เห็นได้ชัด ในอีกไม่นาน ผู้เชี่ยวชาญด้านการป้องกันระบบจะสมัครโครงการ Cyber Verification Program ที่ขยายขอบเขตแล้วได้ เพื่อรับสิทธิ์เข้าถึงความสามารถขั้นสูงแบบแบ่งระดับบน Sonnet 5.5, Opus 5.5 และโมเดลตระกูล Claude Mythos
ด้านชีววิทยา Sonnet 5.5 ใช้มาตรการชุดเดียวกับ Sonnet 5 ซึ่งมุ่งคัดกรองคำขอที่เป็นอันตราย งานวิจัย การศึกษา และงานคลินิกส่วนใหญ่จึงไม่ได้รับผลกระทบ แม้คำขอด้านจุลชีววิทยาและไวรัสวิทยาบางส่วนอาจถูกคัดกรองผิดพลาด องค์กรที่ต้องการใช้งานชีววิทยาเต็มรูปแบบสามารถสมัครโครงการ Life Sciences Verification Program ได้
อีกมาตรการคือการป้องกันการกลั่นโมเดล (Distillation) ซึ่งผู้ไม่หวังดีใช้บัญชีปลอมนับพันดึงความสามารถของโมเดลออกไปในระดับอุตสาหกรรม เพื่อสร้างโมเดลที่เก่งแต่ไม่มีมาตรการป้องกันแบบที่ Claude มี เมื่อ Sonnet 5.5 เก่งกว่ารุ่นก่อนมาก จึงเป็น Sonnet รุ่นแรกที่มาพร้อมระบบคัดกรอง (Classifier) ที่กันการดึงกระบวนการคิดของโมเดลออกไป และขยายฟีเจอร์รักษากระบวนการคิด (Preserved Thinking) ให้กระบวนการคิดของ Claude ผูกติดกับบัญชีที่สร้างขึ้นมาเสมอ นักพัฒนาส่วนใหญ่จะไม่เห็นความเปลี่ยนแปลง ยกเว้นผู้ที่ย้ายบทสนทนาข้ามบัญชี รวมถึงการสลับบัญชีกลางเซสชันใน Claude Code
Claude Sonnet 5.5 เปิดให้ใช้แล้วบนทุกแพลตฟอร์ม รวมถึง Amazon Web Services, Google Cloud และ Microsoft Azure และเลือกใช้แบบไม่เก็บข้อมูล (Zero Data Retention) ได้เช่นเดียวกับ Opus 5.5 และ Sonnet 5 นักพัฒนาบน Claude Platform เรียกใช้ได้ด้วยชื่อโมเดล claude-sonnet-5-5 ส่วนผู้ที่ใช้ Sonnet แบบปิดโหมดการคิด ต้องเปลี่ยนไปใช้การตั้งค่าใหม่ชื่อ between_tools ซึ่งยังคงปิดการคิดก่อนเริ่มตอบไว้ ก่อนย้ายมาใช้ Sonnet 5.5
ที่มา: Anthropic
ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด