Anthropic เปิดตัว Opus 5.5 เก่งระดับ Fable 5.1 แต่ถูกกว่า พิมพ์คุยสื่อสารดีขึ้น กระชับ ตรงประเด็น

งานย้ายโค้ด 680,000 บรรทัดที่ปกติทีมวิศวกรต้องใช้เวลาหลายสัปดาห์ ถูกทำเสร็จภายในไม่ถึงหนึ่งวัน นี่คือหนึ่งในผลลัพธ์ที่ผู้ทดสอบกลุ่มแรกได้จาก Claude Opus 5.5 และสะท้อนจุดขายหลักของรุ่นนี้ได้ชัด คือความสามารถระดับแนวหน้าในต้นทุนที่ลดลงเกือบครึ่ง

Anthropic เพิ่งเปิดตัว Claude Opus 5.5 โมเดลแรกของตระกูล Claude 5.5 ที่ทำงานส่วนใหญ่ได้ในระดับเดียวกับ Claude Fable 5.1 แต่มีต้นทุนการใช้งานต่ำกว่า Claude Opus 5 ราว 40% ในงานทั่วไป และยังเป็นโมเดลแรกที่บริษัทปล่อยออกมาหลังประกาศแนวคิด 'คุมจังหวะการพัฒนา AI แนวหน้า' (Pacing the Frontier) โดยผ่านการทดสอบก่อนเปิดตัวจากหน่วยงานภายนอกอย่าง Frontier Design และ METR

ขึ้นนำหลายสนามทดสอบ แต่ Anthropic บอกเองว่าตัวเลขไม่ได้เล่าทั้งหมด

ในชุดทดสอบมาตรฐาน (Benchmark) ด้านการเขียนโค้ดแบบเอเจนต์ (Agentic Coding) Opus 5.5 ทำคะแนน Terminal-Bench 4.0 ซึ่งวัดการทำงานหลายขั้นตอนบน Command Line Interface (CLI) ได้ 66.4% ทิ้ง Fable 5.1 (55.8%), Opus 5 (52.3%) และ GPT-6 Astra ของ OpenAI (57.9%) ส่วน CursorBench 4.0 ทำได้ 57.8% เทียบกับ 41.7% ของ GPT-5.6 Sol

ฝั่งงานที่ใช้ความรู้ (Knowledge Work) Opus 5.5 ได้ 1846 คะแนน Elo บน GDPval-AA v2.1 ซึ่งวัดงานจริงใน 44 อาชีพ สูงกว่า Fable 5.1 (1735), Opus 5 (1708) และ GPT-6 Astra (1542) นอกจากนี้ยังนำใน OSWorld 2.0 ที่วัดการควบคุมคอมพิวเตอร์ (Computer Use) ด้วยคะแนน 81.8% และ Humanity's Last Exam แบบใช้เครื่องมือที่ 67.7%

Opus 5.5 ไม่ได้ชนะทุกสนาม GPT-6 Astra ยังทำคะแนนสูงกว่าใน AutomationBench ที่วัดงานธุรกิจ (41.4% ต่อ 40.0%) และ Terminal-Bench-Science ที่วัดงานวิจัยวิทยาศาสตร์ (64.6% ต่อ 58.7%) ทั้งนี้ Anthropic ทดสอบโดยเปิดมาตรการป้องกันไว้ตามการใช้งานจริง เมื่อระบบป้องกันทำงาน งานด้านความปลอดภัยไซเบอร์และชีววิทยาบางส่วนจะถูกส่งต่อให้โมเดลรุ่นก่อนทำแทน ซึ่งบริษัทคาดว่ามีผลให้คะแนนต่ำลง

อีกประเด็นที่ Anthropic ยอมรับเองคือ เมื่อโมเดลเก่งถึงระดับนี้ ส่วนต่างคะแนน Benchmark เริ่มบอกความต่างในการใช้งานจริงได้น้อยลง จากการใช้งานภายในบริษัท ช่องว่างระหว่าง Opus 5.5 กับ Fable 5.1 แคบกว่าที่ตัวเลขเหล่านี้บอก

ถูกลงทั้งราคาต่อโทเคนและจำนวนโทเคนที่ใช้

จุดที่ Opus 5.5 ได้เปรียบชัดเจนที่สุดคือประสิทธิภาพด้านต้นทุน เพราะใช้พลังประมวลผลน้อยกว่า Opus 5 ราคาจึงลดลงตาม ค่าอินพุตอยู่ที่ 4 ดอลลาร์ และค่าเอาต์พุต 20 ดอลลาร์ต่อ 1 ล้านโทเคน ถูกลง 20% ค่าอ่านข้อมูลจากแคช (Cache Reads) ซึ่งเป็นต้นทุนก้อนใหญ่ที่สุดของงานเอเจนต์และงานโค้ด ลดลง 60% เหลือ 0.20 ดอลลาร์ ส่วนค่าเขียนแคชลดจาก 6.25 เหลือ 5 ดอลลาร์

เมื่อรวมกับการที่ Opus 5.5 ใช้โทเคนต่องานน้อยลง ต้นทุนรวมจึงลดลงราว 40% โมเดลยังสร้างเอาต์พุตได้เร็วกว่า Opus 5 มากกว่า 30% และสำหรับงานที่ต้องการความเร็วเป็นพิเศษ มีโหมดเร็ว (Fast Mode) บน Claude Code และ Claude Platform ที่เร่งได้สูงสุด 2.5 เท่า ในราคา 8 ดอลลาร์ต่ออินพุต และ 40 ดอลลาร์ต่อเอาต์พุต 1 ล้านโทเคน

ผู้ใช้แบบสมัครสมาชิกก็ได้ประโยชน์ด้วย Anthropic เพิ่มโควตาการใช้งานในรอบ 5 ชั่วโมงให้แพ็กเกจ Pro, Max, Team และ Enterprise แบบคิดตามจำนวนผู้ใช้ พร้อมมอบสิทธิ์รีเซ็ตขีดจำกัดการใช้งาน (Rate Limit) ที่เก็บไว้ใช้เมื่อไรก็ได้

งานโค้ดขนาดใหญ่ระดับทั้งโปรเจกต์ คือสนามที่ Opus 5.5 โดดเด่นที่สุด

Opus 5.5 ถนัดงานยาวที่กินพื้นที่ทั้งโค้ดเบส อย่างการย้ายระบบหรือการตรวจสอบโค้ด ผู้ทดสอบรายหนึ่งใช้ตรวจและแก้โค้ดเบส 200,000 บรรทัดเสร็จภายในไม่ถึง 3 ชั่วโมง ขณะที่ Opus 5 ใช้เวลากว่า 20 ชั่วโมงและกินโทเคนมากกว่า 2.5 เท่า

ในการทดสอบภายใน Anthropic ให้ Opus 5.5 และ Fable 5.1 แปลง HAProxy ซอฟต์แวร์กระจายโหลดทราฟฟิกเว็บที่ใช้กันแพร่หลาย จากภาษา C เป็น Rust ทั้งสองรุ่นเขียนใหม่ได้ผ่านชุดทดสอบของ HAProxy เกือบทั้งหมด แต่ Opus 5.5 ทำเสร็จใน 9.5 ชั่วโมง เทียบกับ 12 ชั่วโมงของ Fable 5.1 และถูกกว่า 51% อีกโจทย์คือให้ลดเวลาโหลดทุกหน้าของเว็บแอป Opus 5.5 ทำสำเร็จ 39 จาก 40 ครั้ง ขณะที่ Opus 5 ปรับปรุงได้น้อยกว่าและยังทำให้พฤติกรรมของแอปเปลี่ยนไป

เมื่อเทียบต้นทุนกับคู่แข่ง ที่ระดับการคิด (Effort) ค่าเริ่มต้น Opus 5.5 ชนะ GPT-6 Astra บน FrontierCode ด้วยต้นทุนต่องานราว 20% ทำคะแนน Terminal-Bench 4.0 เทียบเท่า Astra ด้วยต้นทุนราว 40% และชนะ GPT-5.6 Sol บน CursorBench 11 จุดด้วยต้นทุนราวหนึ่งในสาม

Mario Rodriguez ประธานเจ้าหน้าที่ฝ่ายผลิตภัณฑ์ของ GitHub เล่าว่า 'จากการทดสอบบน GitHub Copilot CLI และ VS Code Claude Opus 5.5 ใช้โทเคนและจำนวนขั้นตอนน้อยที่สุดกลุ่มหนึ่งที่เราเคยวัด ใน VS Code โมเดลแก้โจทย์บนเทอร์มินัลได้มากกว่า Opus 5 โดยใช้ขั้นตอนไม่ถึงครึ่ง ประโยชน์ไม่ได้อยู่แค่งานแต่ละชิ้นที่มีประสิทธิภาพขึ้น แต่ทำให้โปรเจกต์ใหญ่ของนักพัฒนาเป็นไปได้มากขึ้น'

ปล่อยเอเจนต์ทำงานยาวหลายชั่วโมงได้อุ่นใจขึ้น

องค์กรที่ให้เอเจนต์ (Agent) ทำงานในระบบของตัวเองต้องมั่นใจว่าเอเจนต์ทำงานตามที่ตั้งใจไว้ โดยเฉพาะเมื่อปล่อยให้ทำงานเองนานหลายชั่วโมง Opus 5.5 จึงมาพร้อมระบบคัดกรอง (Classifier) ที่ตรวจทุกการกระทำก่อนลงมือ สภาพแวดล้อมจำลองแบบปิด (Sandbox) แบบโอเพนซอร์สที่ทีมความปลอดภัยตรวจสอบได้ และระบบตรวจโค้ดที่จับช่องโหว่ได้ก่อนรวมเข้าโค้ดหลัก

ตัวโมเดลเองก็ต้านทานการแทรกคำสั่งแฝง (Prompt Injection) ได้ดีขึ้น ทำได้เท่าหรือดีกว่า Opus 5 ในทุกรูปแบบที่ทดสอบ ทั้งการเขียนโค้ด การใช้เครื่องมือ การควบคุมคอมพิวเตอร์ และการท่องเว็บ ในการทดสอบของบริษัทความปลอดภัย AI อย่าง Gray Swan Opus 5.5 มีอัตราถูกแทรกคำสั่งสำเร็จต่ำที่สุดร่วมกับ Fable 5.1

งานวิจัยและการเงิน: ค้นข้อมูลเก่ง และไม่แต่งตัวเลขเอง

Anthropic ทดสอบให้ Opus 5.5, Fable 5.1 และ Opus 5 เขียนรายงานผลประกอบการรายไตรมาสของบริษัทหนึ่ง โดยค้นข้อมูลได้จากสำเนาเว็บที่หาเอกสารงบการเงินได้ยาก ระบบตรวจอัตโนมัติจะเช็กทุกตัวเลขและคำพูดกับแหล่งที่มา หากพบข้อมูลที่แต่งขึ้นแม้จุดเดียวถือว่าไม่ผ่าน ผลคือรายงานของ Opus 5.5 ผ่านเกณฑ์ 16 จาก 18 ชิ้น ขณะที่ Fable 5.1 และ Opus 5 ไม่ผ่านเลยสักครั้ง

Walleye Capital บริษัทลงทุนที่ร่วมทดสอบ พบว่า Opus 5.5 แก้โจทย์ประเมินของบริษัทได้เกือบทั้งหมดตั้งแต่ระดับการคิดต่ำสุด และเมื่อเพิ่มระดับการคิด โมเดลยังสังเกตเห็นข้อผิดพลาดในคำสั่งของชุดประเมินและแก้ไขเองได้ ซึ่งยังไม่เคยมีโมเดลไหนจับได้มาก่อน

อีกการทดสอบคือให้วิเคราะห์ดีลควบรวมระหว่างบริษัทซอฟต์แวร์บริหารงานบุคคลสมมติสองแห่ง โดยสร้างแบบจำลองการเงินใน Excel แล้วทำเป็นงานนำเสนอสำหรับผู้บริหารว่าดีลนี้คุ้มราคาหรือไม่ ทั้ง Opus 5.5 และ Opus 5 ได้ข้อสรุปเดียวกัน แต่งานของ Opus 5.5 ละเอียดกว่าและอ่านง่ายกว่า ส่วน Opus 5 มีข้อผิดพลาดเล็กน้อย Opus 5.5 ใช้เวลา 63 นาที เทียบกับ 93 นาที และต้นทุนต่ำกว่า 50% ใน GDPval-AA v2.1 ที่ระดับการคิดค่าเริ่มต้น Opus 5.5 ยังชนะ GPT-6 Astra ที่เปิดระดับการคิดสูงสุด ด้วยต้นทุนต่องานราวหนึ่งในห้า

Carl Bennett ประธานเจ้าหน้าที่ฝ่ายสารสนเทศของ Deloitte Consulting LLP เล่าว่า 'แม้ใช้ระดับการคิดต่ำสุด Claude Opus 5.5 ก็จับบั๊กที่รู้อยู่แล้วในการตรวจโค้ดของเราได้ 72% เทียบกับ 56% ของ Opus 5 ที่ระดับการคิดสูง โดยแจ้งเตือนผิดน้อยกว่าและใช้เอาต์พุตเพียงเศษเสี้ยว'

เขียนอ่านง่ายขึ้น เอาเรื่องสำคัญขึ้นก่อน

การเขียนที่ยืดยาวและตามยากคือคำติที่ Anthropic ได้ยินบ่อยที่สุดเรื่องหนึ่งเกี่ยวกับ Opus 5 รุ่นใหม่นี้จึงปรับวิธีสื่อสารครั้งใหญ่ Opus 5.5 วางข้อมูลสำคัญที่สุดไว้ต้นข้อความ ใช้ศัพท์เฉพาะและสำนวนแปลก ๆ น้อยลง และทำตามกฎการเขียนที่ผู้ใช้กำหนดได้ดีขึ้น ผู้ทดสอบรายหนึ่งบอกว่า 'มันเขียนแบบเดียวกับที่เราเขียน'

ตัวอย่างที่ Anthropic ยกมาคือการให้ทั้งสองรุ่นอธิบายสาเหตุที่รายได้ของลูกค้ารายหนึ่งลดลง Opus 5 เริ่มจากรายละเอียดทางเทคนิคของโค้ด ส่วน Opus 5.5 ขึ้นต้นด้วยข้อสรุปทันทีว่า การเปลี่ยนแพ็กเกจฟรีทำให้รายได้ลดลงเพียง 1.50 ดอลลาร์ อีก 9.92 ดอลลาร์มาจากบั๊กที่ทำให้ระบบไม่คิดค่าใช้งานในวันสุดท้ายของเดือน แล้วจึงอธิบายกลไกตามมา Anthropic มองว่างานที่อ่านและตรวจสอบง่ายขึ้นเป็นประโยชน์ทั้งในการใช้งานและด้านความปลอดภัย

John Ruelas วิศวกรซอฟต์แวร์อาวุโสของ Ramp เล่าว่า 'ผลลัพธ์ที่ยืดยาวและตามยากคือปัญหาที่น่าหงุดหงิดที่สุดของโมเดลระดับแนวหน้า และ Claude Opus 5.5 แก้ปัญหานี้ได้ มันเขียนเหมือนเพื่อนร่วมงานที่เก่ง และทำตามกฎการเขียนของเรา สเปกงานออกแบบที่ได้มาแก้เพียงเล็กน้อยก็ใช้ได้ และเมื่อให้เขียนพรอมต์ของเราใหม่ ฉบับของมันกลับดีกว่าที่เขียนเองเสียอีก'

คุมจังหวะ AI แนวหน้า: งานความปลอดภัยบนสองกรอบเวลา

ก่อนหน้านี้ไม่นาน Dario Amodei ซีอีโอของ Anthropic เสนอว่าการพัฒนา AI ควรเดินในจังหวะที่แนวปฏิบัติด้านความปลอดภัยยังนำหน้าความสามารถของโมเดล Opus 5.5 จึงเป็นรุ่นแรกที่สะท้อนแนวคิดนี้ในทางปฏิบัติ

Anthropic อธิบายว่าบริษัทเข้าใจความเสี่ยงของโมเดลปัจจุบันค่อนข้างดีและรับมือได้ แต่ความเสี่ยงที่ร้ายแรงกว่าอาจเกิดขึ้นเร็วเมื่อความสามารถเพิ่มขึ้น งานความปลอดภัยจึงเดินสองกรอบเวลาพร้อมกัน กรอบแรกคือโมเดลปัจจุบัน ซึ่งใช้การทดสอบการจัดแนวพฤติกรรม (Alignment) อย่างละเอียด การประเมินก่อนเปิดตัวโดยหน่วยงานภายนอก และมาตรการป้องกันที่ปรับตามความสามารถของแต่ละโมเดลในพื้นที่เสี่ยงสูงอย่างไซเบอร์และชีววิทยา พร้อมรายงานความเสี่ยงภายใต้นโยบาย Responsible Scaling Policy ของบริษัท

กรอบที่สองคือการเตรียมรับโมเดลในอนาคต Anthropic กำลังคัดกรองสภาพแวดล้อมที่ใช้ฝึกด้วยการเรียนรู้แบบเสริมกำลัง (Reinforcement Learning) เข้มงวดขึ้น เพราะสภาพแวดล้อมที่มีข้อบกพร่องเป็นต้นเหตุสำคัญของพฤติกรรมที่ผิดเพี้ยน รวมถึงพัฒนาระบบสร้างสถานการณ์ฝึกความปลอดภัยแบบอัตโนมัติ และเร่งงานการตีความกลไกภายในโมเดล (Interpretability) เพื่อลดการพึ่งพาการตรวจกระบวนการคิดที่โมเดลเขียนออกมา (Chain-of-Thought)

สำหรับโมเดลที่เก่งถึงขั้นทำงานวิจัย AI ได้เองทั้งหมด Anthropic มองว่าต้องใช้มาตรฐานความปลอดภัยที่สูงกว่านี้ และบริษัทไม่ได้ถือว่ามาตรการข้างต้นเพียงพอด้วยตัวเอง นโยบายสาธารณะจึงควรมีบทบาทมากขึ้น ซึ่งบริษัทเริ่มวางโครงสร้างรองรับแล้ว รวมถึงความร่วมมือกับ Accenture ที่เพิ่งประกาศไป

ผลทดสอบพฤติกรรมดีที่สุดเท่าที่เคยวัด แต่ยังมีโจทย์ที่ต้องแก้

ในชุดตรวจสอบพฤติกรรมอัตโนมัติที่ครอบคลุมเกือบ 2,000 สถานการณ์ Opus 5.5 ทำได้ดีกว่าโมเดล Claude รุ่นล่าสุดทุกรุ่นในเกือบทุกตัวชี้วัดด้านพฤติกรรมที่ผิดเพี้ยน และเป็นรุ่นที่ซื่อตรงที่สุดในตัวชี้วัดส่วนใหญ่ โมเดลยังพัฒนาขึ้นในพฤติกรรมที่เคยเป็นปัจจัยของเหตุการณ์ด้านความปลอดภัยไซเบอร์ที่ผ่านมา เช่น การใช้เหตุผลแบบลำเอียง ความพยายามหลุดออกจาก Sandbox และการทำสิ่งที่เป็นอันตรายหลังสรุปเองว่าอยู่ในสภาพแวดล้อมจำลอง

ในการทดสอบใหม่ที่วัดแนวโน้มการข้ามขอบเขตที่กำหนดไว้ Opus 5.5 พยายามข้ามขอบเขตน้อยกว่า Opus 5 และ Claude Mythos 5.1 ราว 85% และทุกครั้งที่พยายามล้วนเป็นระดับความรุนแรงต่ำและโมเดลรายงานเอง สำหรับทีมที่ปล่อย Claude ทำงานในระบบโดยไม่มีคนเฝ้า เรื่องนี้สำคัญไม่แพ้ความสามารถ

Anthropic ยอมรับว่าการสร้างชุดทดสอบที่จับความผิดพลาดได้ครบก่อนเปิดใช้งานยังเป็นโจทย์ที่แก้ไม่ตก บริษัทพบสัญญาณว่า Opus 5.5 มักสงสัยว่าตัวเองกำลังถูกทดสอบอยู่ ซึ่งทำให้ประเมินพฤติกรรมในโลกจริงได้ยากขึ้น และคาดว่าปัญหานี้จะหนักขึ้นเรื่อย ๆ หากงาน Interpretability ไม่ก้าวหน้า งาน Alignment จึงต้องทำคู่กับมาตรการป้องกันเสมอ

มาตรการป้องกันระดับเดียวกับ Fable 5.1

Opus 5.5 เป็นโมเดลตระกูล Opus รุ่นแรกที่มาพร้อมมาตรการป้องกันกลุ่มเดียวกับ Fable 5.1 ทั้งด้านไซเบอร์ ชีววิทยา และการกลั่นโมเดล (Distillation) โดยเมื่อระบบป้องกันทำงาน งานจะถูกส่งต่อให้โมเดลอื่นอย่างโปร่งใส

ด้านไซเบอร์ เนื่องจาก Opus 5.5 มีความสามารถสูงมาก ผู้ใช้ยังหาและแก้บั๊กในโค้ดตามรอบพัฒนาซอฟต์แวร์ปกติได้ แต่งานความปลอดภัยไซเบอร์ส่วนใหญ่จะถูกส่งไปให้ Opus 4.8 ทำแทน สำหรับผู้เชี่ยวชาญด้านการป้องกันระบบ Anthropic จะขยายโครงการ Cyber Verification Program ให้ครอบคลุม Opus 5.5 ในอีกไม่กี่สัปดาห์ โดยแบ่งสิทธิ์เข้าถึงเป็น 3 ระดับ รวมถึงการเข้าถึงโมเดลตระกูล Claude Mythos ขณะที่ Claude Security เปิดให้ใช้ Claude Mythos 5.1 แล้ว

ด้านชีววิทยา Opus 5.5 เก่งกว่า Opus 5 และทำได้เท่าหรือดีกว่า Claude Mythos 5.1 ในหลายงาน เช่น การทดสอบทำนายและออกแบบโมเลกุลระยะยาวที่ร่วมทำกับ Dyno Therapeutics ส่วนทีมผู้เชี่ยวชาญที่ทดสอบหาช่องโหว่ (Red Team) ให้คะแนนความใหม่เชิงวิทยาศาสตร์ทัดเทียมโมเดลที่ดีที่สุดที่เคยทดสอบ Opus 5.5 จึงใช้มาตรการด้านชีววิทยาชุดเดียวกับ Fable 5.1 องค์กรที่ผ่านการตรวจสอบ เช่น ห้องแล็บในมหาวิทยาลัย สตาร์ทอัพ และบริษัทยา สามารถสมัครโครงการ Life Sciences Verification Program เพื่อใช้ Opus 5.5 กับงานวิจัยชีววิทยาได้เต็มรูปแบบ

ด้าน Distillation ซึ่งผู้ไม่หวังดีใช้บัญชีปลอมนับพันดึงความสามารถของโมเดลไปสร้างโมเดลของตัวเองที่ไม่มีมาตรการป้องกัน Opus 5.5 มาพร้อมฟีเจอร์รักษากระบวนการคิด (Preserved Thinking) ที่เปิดตัวครั้งแรกกับ Fable 5.1 ฟีเจอร์นี้ป้องกันไม่ให้ผู้ใช้ API แก้บริบทก่อนหน้าเพื่อดึงกระบวนการคิดของ Claude ออกมา มีผลกับบัญชี API ที่สร้างตั้งแต่ 31 สิงหาคม 2026 เป็นต้นไป

นอกจากนี้ Opus 5.5 ยังเลือกใช้แบบไม่เก็บข้อมูล (Zero Data Retention) ได้เหมือน Opus รุ่นก่อน มีลายน้ำดิจิทัลเพื่อให้สอดคล้องกับกฎหมาย AI ของสหภาพยุโรป (EU AI Act) และไม่มีตัวเลือกปิดโหมดการคิดอีกต่อไป

Claude Opus 5.5 เปิดให้ใช้แล้วบนทุกแพลตฟอร์ม รวมถึง Amazon Web Services, Google Cloud และ Microsoft Azure นักพัฒนาบน Claude Platform เรียกใช้ได้ด้วยชื่อโมเดล claude-opus-5-5 ส่วน Claude Sonnet 5.5 และ Claude Haiku 5.5 จะตามมาในอีกไม่กี่สัปดาห์ พร้อมการพัฒนาด้านความสามารถ ความคุ้มค่า และความปลอดภัยในแนวทางเดียวกัน

ที่มา: Anthropic

ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด

No comment

RELATED ARTICLE

Responsive image

OpenAI เปิดตัว GPT-6 Sol และ Luna ดึงความสามารถระดับ Astra ลงมาในราคาถูกลงครึ่งหนึ่ง

OpenAI เปิดตัว GPT-6 Sol และ Luna ลดราคา API 50% ทำคะแนนงานธุรกิจเหนือ Claude Opus 5 ด้วยต้นทุนเพียง 9% ตอบผิดน้อยลงครึ่งหนึ่ง พร้อมระบบแคชใหม่ลดค่าอินพุตซ้ำ 90%...

Responsive image

SCB 10X ชี้เทรนด์ Always-On Economy เศรษฐกิจที่ AI ทำงานแทนคนได้ 24 ชม.

ทุกวันนี้เวลาจะซื้ออะไรหรือทำธุรกรรมสักอย่าง มนุษย์ยังต้องเป็นคนลงมือเอง ตั้งแต่เปิดแอปฯ หาข้อมูล เปรียบเทียบตัวเลือก ตัดสินใจ ไปจนถึงการจ่ายเงิน แต่ถ้า AI ทำงานเหล่านี้แทนเราได้เอ...

Responsive image

OpenAI ออกรายงานแฉโมเดลตัวเอง แอบสั่งตัวเองปิดบังข้อผิดพลาด แถมแอบใช้คลังซอฟต์แวร์ภายในเป็นกระดานฝากข้อความคุยกันเอง

สรุปรายงาน OpenAI 6 ฉบับที่เปิดพฤติกรรมผิดปกติของโมเดลตัวเอง ตั้งแต่โมเดลที่แทรกคำสั่งปิดบังความผิดพลาดใส่บันทึกสรุปงาน ไปจนถึงการล้วงกุญแจ API ที่หลุดบน GitHub แล้วกุตัวเลขส่งให้ผ...