เปิดตัว Claude Haiku 5.5 โมเดลเล็กของ Anthropic ที่เร็วที่สุด

Anthropic เพิ่งเปิดตัว Claude Haiku 5.5 โมเดลขนาดเล็กตัวล่าสุดที่บริษัทเรียกว่า 'ถูกที่สุด เร็วที่สุด และเก่งที่สุด' ในบรรดาโมเดลเล็กที่เคยปล่อยออกมา ต้นทุนการใช้งานเฉลี่ยต่ำกว่า Claude Haiku 4.5 ราว 75% ขณะที่คะแนนด้านการควบคุมคอมพิวเตอร์ (Computer Use) กลับพุ่งจาก 15.7% เป็น 72.4% ภายในรุ่นเดียว

Haiku 5.5 ถูกออกแบบมาเพื่องานปริมาณมากที่ต้องคุมต้นทุน โดยเฉพาะงานเร็วและซ้ำ ๆ อย่างการสรุปความ การย่อบริบท การค้นข้อมูลจากฐานข้อมูล และการจัดหมวดหมู่คำขอ อีกบทบาทหนึ่งคือการเป็นเอเจนต์ผู้ช่วย ที่รับงานย่อยไปทำให้ Opus 5.5 และ Sonnet 5.5 ในงานเขียนโค้ด และเพราะเป็นโมเดลที่เร็วที่สุดของ Anthropic เท่าที่เคยมีมา จึงเหมาะกับงานที่ความเร็วเป็นหัวใจ เช่น งานบริการลูกค้าแบบเรียลไทม์ และการให้ AI ใช้งานเว็บเบราว์เซอร์แทนคน (Browser Use)

งานสองประเภทแรกนี้อาจฟังดูไกลตัว แต่เกิดขึ้นตลอดเวลาเบื้องหลังเอเจนต์ AI โดย Compaction คือการให้ AI ย่อประวัติการทำงานหรือบทสนทนาที่ยาวเกินไปให้สั้นลงแต่ยังเก็บสาระสำคัญไว้ เพื่อให้เอเจนต์ทำงานต่อได้โดยไม่ล้นความจำ ส่วน Subagent คือการที่โมเดลหลักแตกงานใหญ่ออกเป็นงานย่อย แล้วส่งให้โมเดลอื่นรับไปทำคู่ขนานก่อนส่งผลกลับมา งานเหล่านี้มีขอบเขตชัดเจนแต่เกิดขึ้นถี่มาก หากใช้โมเดลใหญ่ทำทั้งหมด ต้นทุนจะสูงจนไม่คุ้ม Haiku 5.5 จึงเข้ามาอุดช่องว่างนี้พอดี

เก่งขึ้นหลายเท่าตัวจาก Haiku 4.5 จนหลายสนามทิ้ง GPT-6 Luna

ตัวเลขจากชุดทดสอบมาตรฐาน (Benchmark) ชี้ว่า Haiku 5.5 ไม่ได้แค่ขยับจากรุ่นก่อน แต่กระโดดไปอีกระดับ ในฝั่งงานที่ใช้ความรู้ (Knowledge Work) Haiku 5.5 ทำได้ 1620 คะแนนบน GDPval-AA v2.1 มากกว่า Haiku 4.5 (735) เกินสองเท่า และสูงกว่า GPT-6 Luna โมเดลรุ่นเล็กของ OpenAI ที่ทำได้ 1437 คะแนน ส่วน AA-Briefcase v1.1 ซึ่งวัดงานความรู้ต่อเนื่องระยะยาว Haiku 5.5 ได้ 1578 คะแนน เทียบกับ 614 ของ Haiku 4.5 และ 1336 ของ GPT-6 Luna

ความก้าวหน้าที่เห็นชัดที่สุดอยู่ที่การควบคุมคอมพิวเตอร์ บนชุดทดสอบย่อยแบบออฟไลน์ของ OSWorld 2.1 ซึ่งวัดว่าเอเจนต์ใช้คอมพิวเตอร์จริงทำงานหลายขั้นตอนจนจบได้ดีแค่ไหน Haiku 5.5 ทำได้ 72.4% จากเดิมเพียง 15.7% ทิ้ง GPT-6 Luna (48.9%) ห่างกว่า 20 จุด และไม่ไกลจาก Sonnet 5.5 ที่ทำได้ 83.9% เช่นเดียวกับการอ่านและตีความกราฟบน Chartography แบบไม่ใช้เครื่องมือที่ได้ 46.4% จากเดิม 6.4% ขณะที่ GPT-6 Luna ทำได้ 29.1%

ด้านการใช้เหตุผลข้ามหลายสาขาวิชาบน Humanity's Last Exam Haiku 5.5 ทำได้ 45.9% เมื่อไม่ใช้เครื่องมือ และ 57.4% เมื่อใช้เครื่องมือ เพิ่มขึ้นจาก 10.2% และ 18.7% ของรุ่นก่อนตามลำดับ

ส่วนงานเขียนโค้ดแบบเอเจนต์ (Agentic Coding) บน Terminal-Bench 4.0 ซึ่งวัดการทำงานหลายขั้นตอนบนหน้าจอคำสั่ง (Command Line Interface: CLI) Haiku 5.5 ทำได้ 39.2% ขณะที่ Haiku 4.5 ทำไม่ได้เลยแม้แต่ข้อเดียว (0.0%) และ GPT-6 Luna ทำได้ 16.4% ส่วนบน FrontierCode 1.1 Haiku 5.5 ได้ 46.4% สูงกว่า GPT-6 Luna ที่ 42.4%

ถึงอย่างนั้น Anthropic ก็ย้ำเองว่าคะแนน Terminal-Bench 4.0 ของ Haiku 5.5 ยังห่างจาก Sonnet 5.5 (70.6%) อยู่มาก งานเขียนโค้ดแบบเอเจนต์ที่ซับซ้อนจึงยังควรใช้ Sonnet 5.5 หรือ Opus 5.5 ส่วน Haiku 5.5 เหมาะกับงานที่ขอบเขตแคบกว่า ซึ่งเดิมแพงเกินไปที่จะใช้ Claude รุ่นก่อน ๆ ทำ เช่น การย่อบริบท การสรุปความ และงานของ Subagent

Haiku รุ่นแรกที่ปรับ 'ระดับการคิด' ได้

อีกสิ่งที่ทำให้ Haiku 5.5 ต่างจากรุ่นก่อนคือการเป็นโมเดลตระกูล Haiku รุ่นแรกที่ปรับระดับการคิด (Effort) ได้เหมือนโมเดลรุ่นใหญ่ ผู้ใช้จึงเลือกได้เองว่างานไหนจะเน้นประหยัดต้นทุน และงานไหนจะยอมจ่ายเพิ่มเพื่อแลกกับความฉลาด Anthropic ได้เผยกราฟเทียบความแม่นยำกับต้นทุนในแต่ละระดับบนสามสนาม คือ OSWorld, GDPval-AA และ Humanity's Last Exam ให้นักพัฒนาใช้ประกอบการตัดสินใจ

ความเร็วที่ Anthropic โฆษณาไว้ยังได้รับการยืนยันจากลูกค้าที่ทดสอบช่วงแรก ซึ่งมีทั้ง Asana, HubSpot, AlphaSense, Box, Rogo และ Cognition โดยรายงานผลไปในทางเดียวกับตัวเลขด้านประสิทธิภาพและต้นทุนที่บริษัทเปิดเผย

คุณ Aaron Vinh วิศวกรซอฟต์แวร์อาวุโส (Staff Software Engineer) ของ Asana เล่าว่า 'เราประทับใจ Claude Haiku 5.5 มาก โดยเฉพาะความเร็ว เราทดสอบโมเดลกับชุดประเมินของ AI Teammates ผลิตภัณฑ์เอเจนต์ AI ของเรา ครอบคลุมทั้งการคัดแยกบั๊ก การตั้งค่าโปรเจกต์ และการค้นหาในพอร์ตงานขนาดใหญ่เพื่อดึงงานที่เสี่ยงสูงหรือเลยกำหนดขึ้นมา เมื่อเทียบกับโมเดลที่ใช้อยู่ตอนนี้ เวลาที่ใช้ทำงานแต่ละชิ้นจนเสร็จลดลงกว่า 30% และเอเจนต์ประมวลผลแต่ละรอบได้เร็วขึ้นสูงสุด 2.5 เท่า ประสบการณ์ใช้งานลื่นไหลขึ้นอย่างเห็นได้ชัด'

ค่าโทเคนถูกลง 10 เท่า สำหรับคำขอ 9 ใน 10 ครั้ง

เมื่อความสามารถขยับขึ้นขนาดนี้ เรื่องที่น่าสนใจไม่แพ้กันคือราคาที่ลดลงสวนทาง Haiku 5.5 ใช้โครงสร้างราคาแบบสองขั้น โดยแบ่งตามความยาวของพรอมต์ที่ 100,000 โทเคน (Token) ซึ่งเป็นหน่วยนับข้อความที่ AI ประมวลผล

สำหรับพรอมต์ไม่เกิน 100,000 โทเคน ค่าอินพุตอยู่ที่ 0.10 ดอลลาร์ต่อ 1 ล้านโทเคน และเอาต์พุต 0.50 ดอลลาร์ ถูกกว่า Haiku 4.5 ที่คิด 1 ดอลลาร์และ 5 ดอลลาร์ถึง 10 เท่า ส่วนพรอมต์ที่ยาวเกิน 100,000 โทเคน ค่าอินพุตอยู่ที่ 0.50 ดอลลาร์ และเอาต์พุต 2.50 ดอลลาร์ หรือราวครึ่งหนึ่งของรุ่นก่อน

ราคาแคช (Cache) ก็ลดลงในสัดส่วนเดียวกัน แคชคือการเก็บส่วนของพรอมต์ที่ต้องส่งซ้ำ เช่น คำสั่งตั้งต้นหรือเอกสารชุดเดิม ไว้ให้เรียกอ่านซ้ำได้ในราคาถูกกว่าการส่งใหม่ทุกครั้ง โดย Haiku 5.5 คิดค่าเขียนแคช (Cache Writes) 0.125 ดอลลาร์ และค่าอ่านแคช (Cache Reads) 0.01 ดอลลาร์ต่อ 1 ล้านโทเคน สำหรับพรอมต์ไม่เกิน 100,000 โทเคน และ 0.625 ดอลลาร์กับ 0.05 ดอลลาร์สำหรับพรอมต์ที่ยาวกว่านั้น เทียบกับ 1.25 ดอลลาร์และ 0.10 ดอลลาร์ของ Haiku 4.5

เส้นแบ่งที่ 100,000 โทเคนนี้ไม่ได้ตั้งขึ้นลอย ๆ เพราะราว 90% ของคำขอที่ส่งเข้า Haiku รุ่นก่อนมีพรอมต์ไม่เกินระดับนี้ งานส่วนใหญ่ที่ใช้ Haiku อยู่แล้วจึงได้ราคาขั้นที่ถูกที่สุด และเมื่อคิดรวมทุกงานแล้ว ต้นทุนการใช้ Haiku 5.5 จะต่ำกว่า Haiku 4.5 เฉลี่ยราว 75%

Sonnet 5.5 ถูกลง 20% และสมาชิก Max กับ Team ได้เครดิต API ทุกเดือน

การลดราคาไม่ได้หยุดอยู่ที่ Haiku เพราะตั้งแต่วันนี้ Anthropic ลดค่าอ่านแคชของ Sonnet 5.5 ลง 50% จาก 0.20 ดอลลาร์เหลือ 0.10 ดอลลาร์ต่อ 1 ล้านโทเคน การอ่านแคชเป็นสัดส่วนใหญ่ของโทเคนที่โมเดลใช้ไปในแต่ละงาน ผลคือต้นทุนของ Sonnet 5.5 ในงานแบบเอเจนต์ส่วนใหญ่ลดลงราว 20% ซึ่ง Anthropic แสดงให้เห็นผ่านกราฟความแม่นยำเทียบต้นทุนบน Terminal-Bench 4.0 ที่ขยับมาทางคุ้มค่ากว่าเดิม

ภายในสัปดาห์นี้ Anthropic ยังจะทยอยแจกเครดิต API รายเดือนให้สมาชิก Max และ Team ทุกคน สำหรับใช้งานบน Claude Platform โดยสมาชิก Max 5x ได้ 100 ดอลลาร์ต่อเดือน Max 20x ได้ 200 ดอลลาร์ และ Team ได้สูงสุด 500 ดอลลาร์ ซึ่งใช้ร่วมกันทั้งทีม เครดิตนี้ใช้ได้กับทุกโมเดล และตั้งใจให้ผู้ใช้ได้ทดลองสร้างเครื่องมือ แอป และเอเจนต์ที่เรียกใช้ API ของ Claude

ฝั่งนักพัฒนา Anthropic ยังอัปเดต Software Development Kit (SDK) ของ Claude ทั้งภาษา Python และ TypeScript ให้รองรับการควบคุมคอมพิวเตอร์และการใช้งานเบราว์เซอร์ในสถานะทดลอง (Beta) ซึ่ง Haiku 5.5 เหมาะกับงานกลุ่มนี้เป็นพิเศษ เพราะรวมความเร็ว ความสามารถ และราคาไว้ในตัวเดียว

ปลอดภัยขึ้น และเปิดทางให้งานป้องกันไซเบอร์กว้างกว่า Sonnet 5.5

ในด้านความปลอดภัย Haiku 5.5 พัฒนาขึ้นจาก Haiku 4.5 อย่างชัดเจนในการประเมินด้านการวางแนวพฤติกรรม (Alignment) เกือบทุกชุด โดยพบพฤติกรรมที่ไม่สอดคล้องกับเจตนาของผู้ใช้น้อยลงมาก และมีแนวโน้มให้ความร่วมมือกับการนำไปใช้ในทางที่ผิดต่ำลง รายละเอียดของกระบวนการและผลการประเมินเปิดเผยไว้ในเอกสาร System Card ของโมเดล

ส่วนมาตรการป้องกัน (Safeguards) ด้านไซเบอร์ปรับตามระดับความสามารถที่สูงขึ้น จึงเข้มงวดกว่า Haiku 4.5 แต่ผ่อนกว่าโมเดลรุ่นใหม่ตัวอื่นของ Anthropic อยู่บ้าง ผลคือ Haiku 5.5 รับงานด้านป้องกันระบบได้กว้างกว่ามาตรการของ Sonnet 5.5 แต่ยังบล็อกการทดสอบเจาะระบบ (Penetration Testing) และเทคนิคอื่นที่มีแนวโน้มถูกนำไปใช้โจมตี

ด้านชีววิทยา Haiku 5.5 ใช้มาตรการชุดเดียวกับ Sonnet 5, Sonnet 5.5 และ Opus 5 ซึ่งตอบคำถามเชิงวิจัยได้ แต่จำกัดคำขอที่ประเมินแล้วว่ามีแนวโน้มก่ออันตราย องค์กรที่ต้องทำงานด้านชีววิทยาหรือไซเบอร์ในขอบเขตกว้างกว่านี้ สามารถสมัครโครงการ Life Sciences Verification Program และ Cyber Verification Program ได้

Claude Haiku 5.5 เปิดให้ใช้แล้วบนทุกแพลตฟอร์ม รวมถึง Amazon Web Services, Google Cloud และ Microsoft Azure นักพัฒนาบน Claude Platform เรียกใช้ได้ด้วยชื่อโมเดล claude-haiku-5-5 และดูรายละเอียดการย้ายจากรุ่นเดิมได้ในคู่มือการย้ายระบบ (Migration Guide) ของ Anthropic

ที่มา: Anthropic

ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด

No comment

RELATED ARTICLE

Responsive image

Google เปิดตัว Playground แพลตฟอร์มสร้างเกมด้วย AI แค่ Prompt ก็ได้เกม ไม่ต้องเขียนโค้ด

Google เปิดตัว Playground แพลตฟอร์มทดลองจาก Google Labs ให้ทุกคนสร้างเกมด้วย AI แค่พิมพ์บอก ไม่ต้องเขียนโค้ด เล่นและแชร์ได้บนเบราว์เซอร์ พร้อมเตรียมเชื่อม Unity Spark ต่อยอดสู่เกม ...

Responsive image

Google เปิด synthid.com ให้ใช้ฟรี เช็กง่าย ๆ รูป-วิดีโอ-เสียง ชิ้นไหนมาจาก AI

Google เปิดตัว synthid.com ให้คนทั่วไปใช้งานได้ฟรี ตรวจจับรูปภาพ วิดีโอ และเสียงจาก AI ได้ง่าย ๆ ด้วยระบบลายน้ำดิจิทัล...

Responsive image

รู้จัก Intelligent UI ใน GPT-6 กราฟ แผนที่ ปุ่ม ฟอร์ม รวมอยู่ในแชตเดียว

OpenAI ปล่อย GPT-6 ให้ผู้ใช้ ChatGPT ทุกระดับรวมถึงผู้ใช้ฟรี พร้อม Intelligent UI ที่ตอบด้วยกราฟ แผนที่ ปุ่ม และสร้างเครื่องมือให้ใช้ในแชตได้ทันที ตอบไปคิดไปได้ และเริ่มตอบเร็วขึ้น...