
ในการทดสอบงานธุรกิจที่ต้องสลับใช้แอปหลายตัว GPT-6 Sol ทำคะแนนเหนือ Claude Opus 5 ที่เปิดกำลังสูงสุด ด้วยต้นทุนต่องานเพียง 9% ของคู่แข่ง ตัวเลขนี้สรุปเกมที่ OpenAI กำลังเล่นได้ดี เพราะการแข่งขันของโมเดล AI ไม่ได้วัดกันแค่ว่าใครฉลาดที่สุดอีกต่อไป แต่วัดว่าใครส่งความฉลาดระดับแนวหน้าให้ใช้งานได้ทุกวันในราคาที่จ่ายไหว
หลังเปิดตัว GPT-6 Astra โมเดลเรือธงที่บริษัทเรียกว่าฉลาดที่สุดในโลกไปได้ไม่นาน OpenAI ก็ขยายตระกูล GPT-6 ด้วยสองรุ่นใหม่ คือ GPT-6 Sol รุ่นกลางสำหรับงานยาก และ GPT-6 Luna รุ่นเล็กที่เน้นความคุ้มค่า ทั้งคู่เทรนด้วยวิธีคล้ายกับ Astra จึงได้พัฒนาการด้านงานมืออาชีพ ความถูกต้องของข้อเท็จจริง การเขียนโค้ด การควบคุมคอมพิวเตอร์ และความสอดคล้องกับเจตนามนุษย์ (Alignment) ติดมาด้วย แต่เร็วกว่าและถูกกว่า ส่วน Astra ยังเป็นตัวเลือกสำหรับงานที่ต้องการผลลัพธ์ดีที่สุดโดยไม่ยอมลดทอนอะไรเลย
OpenAI อธิบายว่าการพัฒนาระบบแคช (Caching) และการประมวลผลโมเดล (Inference) ทำให้ต้นทุนการให้บริการลดลง และบริษัทเลือกส่งส่วนต่างนั้นให้ผู้ใช้โดยตรง ราคา API ของ Sol และ Luna จึงลดลง 50% เมื่อเทียบกับราคาโปรโมชันของรุ่น GPT-5.6
GPT-6 Sol คิดราคา 2 ดอลลาร์สหรัฐต่อ 1 ล้านโทเคนขาเข้า และ 10 ดอลลาร์สหรัฐต่อ 1 ล้านโทเคนขาออก ลดจาก 4 และ 20 ดอลลาร์สหรัฐของ GPT-5.6 Sol ส่วน GPT-6 Luna อยู่ที่ 0.10 และ 0.50 ดอลลาร์สหรัฐตามลำดับ เทียบกับ GPT-6 Astra ที่ 10 และ 50 ดอลลาร์สหรัฐ ช่องว่างราคาระหว่างรุ่นบนสุดกับรุ่นเล็กสุดจึงห่างกันถึง 100 เท่า ราคาชุดนี้เป็นราคาถาวร ไม่ใช่ราคาโปรโมชัน
ชุดทดสอบที่ OpenAI ยกมาเป็นอันดับแรกคือ AutomationBench ของ Zapier ซึ่งให้เอเจนต์ AI ทำงานแบบครบวงจรโดยใช้เครื่องมือ 47 ตัว ครอบคลุมงานขาย การตลาด ปฏิบัติการ บริการลูกค้า การเงิน และทรัพยากรบุคคล GPT-6 Sol ที่ระดับการใช้เหตุผล (Reasoning Effort) แบบ xhigh ทำคะแนนเหนือ Claude Opus 5 ที่ระดับ max ด้วยต้นทุนต่องานเพียง 9% และยังเหนือ Claude Fable 5.1 รวมถึง GPT-6 Astra ที่ระดับ low ด้วย
OpenAI หมายเหตุไว้ว่าต้นทุนของ Fable 5.1 ในกราฟต่ำกว่าความเป็นจริง เพราะไม่ได้รวมค่าใช้จ่ายตอนระบบสลับไปใช้ Opus 5 แทน ซึ่งเกิดขึ้นราว 40% ของงานทั้งหมด ด้าน GPT-6 Luna ที่ระดับ high ทำคะแนนดีกว่ารุ่นก่อน 5.4 จุดเปอร์เซ็นต์ ด้วยต้นทุนต่องานที่ต่ำลง 58%
ใน Agents' Last Exam ซึ่งวัดความสามารถของเอเจนต์ในงานมืออาชีพที่ซับซ้อน GPT-6 Sol ที่ระดับ max ได้ 56.4% สูงกว่าคะแนนดีที่สุดของ Claude Opus 5 ในชุดทดสอบนี้ และถูกกว่า 60% ต่องาน
ความถูกต้องของข้อเท็จจริงเป็นอีกจุดที่ OpenAI เน้น การประเมินภายในของบริษัทใช้บทสนทนาจริงที่ปกปิดตัวตนแล้ว ซึ่งผู้ใช้เคยแจ้งว่าโมเดลรุ่นก่อนตอบผิด ผลคือ GPT-6 Sol ทำผิดพลาดน้อยกว่ารุ่นก่อนราวครึ่งหนึ่ง จนเข้าใกล้ความน่าเชื่อถือระดับ Astra ในราคาที่ต่ำกว่ามาก ขณะที่ GPT-6 Luna ที่ระดับการใช้เหตุผลสูงทำได้เทียบเท่า GPT-5.6 Sol ด้วยต้นทุนราวหนึ่งในร้อย
OpenAI ระบุว่าบทสนทนาชุดนี้ถูกคัดมาเพราะเคยทำให้โมเดลตอบผิด จึงไม่สะท้อนการใช้งานทั่วไปที่ข้อผิดพลาดเกิดขึ้นน้อยกว่านี้
เหตุผลที่ต้นทุนสำคัญขึ้นเรื่อย ๆ เห็นได้จากใน OpenAI เอง บริษัทเปิดเผยว่าหากคิดตามราคา API นักวิจัยระดับกลางของบริษัทใช้โทเคนวันละกว่า 600 ดอลลาร์สหรัฐ และกลุ่มที่ใช้หนักที่สุด 10% บนสุดใช้เกิน 7,000 ดอลลาร์สหรัฐต่อวัน เมื่อเอเจนต์เขียนโค้ดรับงานที่ยาวและหนักขึ้น ต้นทุนการใช้งานต่อเนื่องก็กลายเป็นตัวจำกัดว่าทีมกล้าสั่งงาน Codex ได้ใหญ่แค่ไหน
ใน FrontierCode ที่วัดว่าโค้ดของเอเจนต์พร้อมรวมเข้าโค้ดเบสจริงได้หรือไม่ GPT-6 Sol ทำได้ดีกว่า GPT-5.6 Sol อย่างชัดเจน และทำได้ทัดเทียม Claude Fable 5.1 ที่ระดับ xhigh ด้วยต้นทุนที่ต่ำกว่ามาก
ใน DeepSWE v1.1 ซึ่งทดสอบงานวิศวกรรมซอฟต์แวร์ซับซ้อนในโค้ดเบสจริง GPT-6 Sol ที่ระดับ max ได้ 68.8% ห่างจากคะแนนสูงสุดของ Claude Fable 5 ที่ 69.9% เพียง 1.1 จุดเปอร์เซ็นต์ แต่ถูกกว่าราว 80% ต่องาน ส่วน GPT-6 Luna ที่ระดับ max ได้ 66.6% ใกล้เคียง Claude Opus 5 และ Fable 5 ที่ระดับ medium ขณะที่ต้นทุนต่องานต่ำกว่า Opus 5 ถึง 93% และต่ำกว่า Fable 5 ถึง 96%
แม้ OpenAI ยังยก GPT-6 Astra เป็นโมเดลที่ควบคุมคอมพิวเตอร์ (Computer Use) ได้ดีที่สุดในโลก แต่สองรุ่นใหม่ก็คุ้มค่ากว่ารุ่นก่อนชัดเจน ใน OSWorld 2.0 ชุดออฟไลน์ ซึ่งให้เอเจนต์ทำงานบนคอมพิวเตอร์ต่อเนื่องยาว ๆ ทั้งงานประจำวันและงานมืออาชีพ GPT-6 Sol ที่ระดับ xhigh ได้ 60.5% ใกล้เคียง Claude Opus 5 ที่ระดับ medium ซึ่งได้ 60.3% แต่ถูกกว่าราว 80% ต่องาน ส่วน GPT-6 Luna ที่ระดับ max ทำได้ดีกว่า GPT-5.6 Sol ที่ระดับ medium ด้วยต้นทุนหนึ่งในสิบ
นอกจากความสามารถ Sol และ Luna ยังได้สไตล์การสื่อสารแบบเดียวกับ Astra ซึ่ง OpenAI คาดว่าจะเห็นชัดที่สุดในบทสนทนาเชิงเทคนิคและการเขียนโค้ด คำตอบจะชัดเจนขึ้น ใช้ศัพท์เฉพาะน้อยลง ตัดรายละเอียดที่ไม่จำเป็น และสั้นลงเล็กน้อยโดยสาระไม่หาย
ตัวอย่างที่บริษัทยกมาคือคำขอให้ปรับเว็บไซต์เป็นดีไซน์แบบ Bento Box คำตอบของ GPT-6 Sol ไม่ด่วนสรุป ไม่ย้ำสิ่งที่ผู้ถามรู้อยู่แล้ว ใช้ภาษาคลุมเครือน้อยกว่า บอกตรง ๆ ว่าตรวจสอบอะไรไปแล้วและอะไรยังไม่ได้ตรวจ และไม่เปิดเผยรายละเอียดเบื้องหลังที่ไม่จำเป็น เช่น คำสั่งที่ใช้กับเครื่องมือสร้างภาพ
สำหรับนักพัฒนา นอกจากราคาโทเคนที่ถูกลง OpenAI ยังปรับระบบแคชพรอมต์ (Prompt Caching) ของ GPT-6 ให้เก็บบริบทที่ใช้ซ้ำได้มากขึ้นโดยอัตโนมัติ ทำให้เอเจนต์ตอบเร็วขึ้น และได้ส่วนลด 90% สำหรับการอ่านอินพุตที่แคชไว้
บริษัทยังเพิ่มเครื่องมือให้นักพัฒนาวัดและปรับแคชเองได้ ตั้งแต่แดชบอร์ด Prompt Caching ที่แสดงว่าอินพุตถูกแคชไว้มากแค่ไหน เครื่องมือวินิจฉัยที่บอกว่าพลาดโอกาสแคชตรงไหนและต้องแก้อะไร ไปจนถึงการปรับระดับการใช้เหตุผลหรือเปิดปิดเครื่องมือระหว่างบทสนทนาได้โดยแคชไม่หลุด และการกำหนดจุดตัด (Breakpoint) เองว่าจะให้แคชพรอมต์ถึงตรงไหน
ผลลัพธ์จริงมีให้เห็นแล้วจาก GitHub ซึ่งระบุว่าในช่วงหลายเดือนที่ผ่านมา การปรับปรุงเหล่านี้ลดสัดส่วนโทเคนพรอมต์ที่ต้องประมวลผลใหม่ลงกว่า 50% จากคำขอหลายพันล้านครั้งไปยังโมเดลของ OpenAI ช่วยให้ Copilot ตอบสนองได้เร็วขึ้น
GPT-6 Sol และ Luna ต่อยอดงานด้าน Alignment จาก Astra ซึ่ง OpenAI เรียกว่าโมเดลที่สอดคล้องกับเจตนามนุษย์มากที่สุดของบริษัท ผลประเมินชี้ว่าทั้งสองรุ่นดีกว่ารุ่น GPT-5.6 รวมถึงอ้างผลงานเขียนโค้ดของตัวเองแบบชวนเข้าใจผิดน้อยลง ทั้งนี้บริษัทระบุว่าชุดทดสอบถูกออกแบบให้เจอสถานการณ์ยาก จึงไม่ได้สะท้อนอัตราความผิดพลาดในการใช้งานทั่วไป
GPT-6 Sol และ GPT-6 Luna เปิดให้ใช้บน ChatGPT Work และ Codex แล้วสำหรับผู้ใช้ Plus, Pro, Business, Enterprise และ Edu ส่วนผู้ใช้ Free และ Go ใช้ GPT-6 Luna ได้ผ่านแอปเดสก์ท็อป แต่ยังไม่มีให้ใช้ในโหมด Chat ฝั่ง API เรียกใช้ได้ผ่านชื่อโมเดล gpt-6-sol และ gpt-6-luna โดย OpenAI จะทยอยเปิดใน ChatGPT ตลอดทั้งวันเพื่อรักษาเสถียรภาพของระบบ
ที่มา: OpenAI
ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด