
ทีมเอเจนต์ AI ไล่วิเคราะห์ข้อมูลการทำงานของเครื่องทั้งหมดในดาต้าเซ็นเตอร์ของ Google แล้วลงมือปรับแต่งการใช้หน่วยความจำเองโดยอัตโนมัติ จนคืนหน่วยความจำกลับมาได้กว่า 300 TiB และคาดว่าเมื่อรวมทั้งหมดจะประหยัดได้ 500 TiB ถึง 1 PiB งานนี้เป็นฝีมือของ Gemini 4 Argon ซึ่งทำงานอยู่ใน Google มาสักพักแล้ว ก่อนที่คนภายนอกจะได้ใช้เสียอีก
Google เพิ่งเปิดตัว Gemini 4 Argon โมเดลระดับแนวหน้า (Frontier Model) ตัวใหม่ที่ออกแบบมาให้คิดเชิงลึกได้ต่อเนื่องในงานซับซ้อนที่กินเวลานานและมีหลายขั้นตอน จุดแข็งอยู่ที่สามสนาม ได้แก่ งานวิศวกรรมซอฟต์แวร์ในโลกจริง งานที่ใช้ความรู้ขององค์กรอย่างกฎหมายและการเงิน และการป้องกันภัยไซเบอร์ แต่ยังไม่เปิดให้ทุกคนใช้ทันที ล็อตแรกส่งถึงมือผู้เชี่ยวชาญด้านการป้องกันไซเบอร์ที่ผ่านการคัดเลือกในโครงการ Fairwind Program ก่อน
พนักงาน Google หลายพันคนที่ใช้ Argon อยู่ในงานประจำชี้ตรงกันว่าโมเดลเด่นเรื่องงานเขียนโค้ดเฉพาะทาง การค้นคว้าเชิงลึก และคุณภาพงานเขียน ฝั่งทีมวิจัยควอนตัม Argon ช่วยลดทรัพยากรที่ต้องใช้ (จำนวนคิวบิตคูณจำนวนเกต) ของโปรแกรมย่อยที่เป็นคอขวดของแอปพลิเคชันสำคัญ ในกรณีหนึ่งโมเดลใช้เวลาไม่กี่นาทีก็ทำผลลัพธ์ได้ดีกว่าค่าอ้างอิงที่เคยตีพิมพ์ไว้ 40%
อีกงานใหญ่คือการย้ายโค้ดเบสภาษา C/C++ ไปเป็นภาษา Rust ทั่วทั้ง Google ตั้งแต่ไลบรารีหลักขนาดหลายหมื่นบรรทัดอย่าง re2 และ libgav1 ไปจนถึงเคอร์เนล Zircon ของระบบปฏิบัติการ Fuchsia ที่ยาวกว่า 800,000 บรรทัด เนื่องจากหลายระบบเป็นระบบสำคัญ โค้ดที่เขียนใหม่จึงต้องผ่านการตรวจทั้งแบบอัตโนมัติและโดยคน ทดสอบบนระบบจำลอง และรีวิวอย่างเข้มงวดก่อนขึ้นใช้งานจริง
กรณี libgav1 ซอฟต์แวร์โอเพนซอร์สสำหรับถอดรหัสวิดีโอของ Google เห็นผลชัดที่สุด เอเจนต์ของ Argon นำเวอร์ชัน Rust ที่มีอยู่แล้วมาแทนที่โค้ดเร่งความเร็วแบบประมวลผลข้อมูลหลายชุดพร้อมกัน (Single Instruction, Multiple Data หรือ SIMD) รวม 32,000 บรรทัด วิธีคือทดลองปรับโค้ดหลายรอบตามข้อมูลประสิทธิภาพที่วัดได้จริง ศึกษาผลลัพธ์จากคอมไพเลอร์ แล้วเขียนโค้ด Rust แบบปลอดภัยที่คอมไพเลอร์แปลงเป็นคำสั่งประมวลผลแบบขนานได้เอง ผลที่ได้คือตัวถอดรหัสวิดีโอที่ปลอดภัยด้านหน่วยความจำ (Memory-safe) เร็วกว่าเวอร์ชัน Rust เดิม 2.7 เท่า ให้ภาพออกมาเหมือนเดิมทุกประการ และเข้าใกล้ความเร็วของเวอร์ชัน C++ ที่ปรับแต่งมาอย่างดี
งานที่ยาวและซับซ้อนขนาดนี้ต้องการพื้นที่ให้โมเดลคิดและเขียนได้มากพอ Google จึงขยายขีดจำกัดโทเคนเอาต์พุตของ Argon จาก 64,000 โทเคนในรุ่นก่อน เป็น 1 ล้านโทเคน ซึ่ง Google บอกว่าสูงที่สุดในอุตสาหกรรม โทเคนเอาต์พุตคือปริมาณข้อความหรือโค้ดที่โมเดลสร้างได้ในการตอบหนึ่งครั้ง เมื่อโมเดลคิดลึกและสร้างผลลัพธ์ได้หลายแสนโทเคนในรอบเดียว ก็แก้โจทย์ยากได้จบในครั้งเดียว

วิศวกรของ Google ใช้ Argon ตั้งแต่แก้บั๊กทั่วไป ย้ายโค้ดเบสขนาดใหญ่ ไปจนถึงออกแบบอัลกอริทึม บนชุดทดสอบมาตรฐาน (Benchmark) DeepSWE v1.1 ที่วัดงานวิศวกรรมซอฟต์แวร์ระยะยาวในโลกจริง Argon ทำได้ 77.9% สร้างสถิติใหม่ของวงการ
นอกงานโค้ด Argon ขึ้นอันดับหนึ่งบน Vals Index ซึ่งวัดผลกระทบทางเศรษฐกิจจากงานด้านการเงิน การเขียนโค้ด กฎหมาย และภาษี โดยถ่วงน้ำหนักแต่ละสาขาตามสัดส่วนที่มีต่อผลิตภัณฑ์มวลรวมในประเทศ (GDP) ของสหรัฐฯ ผลลัพธ์ไปในทางเดียวกันบนชุดทดสอบเฉพาะทางอย่าง Vals Finance Agent v2 ที่วัดการค้นคว้าข้อมูลการเงินหลายขั้นตอน และ Legal Agent Benchmark ของ Harvey ที่วัดการค้นคว้าและร่างเอกสารกฎหมาย ส่วน AutomationBench ของ Zapier ที่วัดการทำงานครบวงจรในฟังก์ชันหลักของธุรกิจ Argon ครองอันดับหนึ่งด้วยคะแนน 51.3%
Argon ยังโดดเด่นเป็นพิเศษในงานที่ต้องเข้าใจภาพ ทั้งการวิเคราะห์กราฟระดับมืออาชีพ การจับรายละเอียดจากวิดีโอความยาวสูง และการลงมือทำงานต่อจากเอกสารหลายชิ้น บน LVBench ที่วัดความเข้าใจวิดีโอขนาดยาว Argon ทำได้ 91.7% สูงสุดในตอนนี้
Google ฝึก Argon ให้เก่งด้านการป้องกันภัยไซเบอร์โดยเฉพาะ เพื่อให้ฝ่ายป้องกันพร้อมรับมือภัยไซเบอร์รูปแบบใหม่ โมเดลค้นหา ยืนยัน และแก้ช่องโหว่ร้ายแรงในซอฟต์แวร์ได้เองโดยอัตโนมัติ สำหรับผู้เชี่ยวชาญที่ผ่านการคัดเลือกและทีมภายใน Google บริษัทจะเปิดใช้ Argon แบบไม่มีมาตรการจำกัดด้านไซเบอร์ (Cyber Guardrails) เพื่อให้ใช้ความสามารถด้านการป้องกันได้เต็มที่
Wiz เริ่มใช้ Argon แล้วในโครงการ Scan for Good ซึ่งช่วยปกป้องโครงสร้างพื้นฐานสาธารณะที่สำคัญแบบไม่คิดค่าใช้จ่าย ด้วยการค้นหาและปิดจุดเสี่ยงสูง ในการสาธิตช่วงแรก โมเดลพบช่องโหว่ร้ายแรงในซอฟต์แวร์ด้านสาธารณสุขที่โรงพยาบาลทั่วโลกใช้ ซึ่งเปิดช่องให้ข้อมูลส่วนบุคคลที่อ่อนไหวรั่วไหลได้ และเป็นความเสี่ยงที่โมเดลแนวหน้ารุ่นก่อน ๆ มองข้ามไป
บน CWE-bench v1 ที่วัดความสามารถในการแก้ช่องโหว่ความปลอดภัย Argon ทำได้ 68% เสมอกันในอันดับหนึ่ง ต่อยอดจาก Gemini 3.8 Flash Cyber ที่เคยทำผลงานแนวหน้าบน CWE-bench v0 ด้านการค้นหาช่องโหว่ Argon ก็ทำได้ดีกว่า 3.8 Flash Cyber แบบก้าวกระโดด บนชุดทดสอบช่องโหว่ภายในของ Google โมเดลพบจุดเสี่ยงหลากหลายในโค้ดเบสซับซ้อนที่ครอบคลุม 20 ภาษาโปรแกรม ส่วนชุดทดสอบเจาะระบบแบบไม่เห็นซอร์สโค้ด (Black-box Penetration Testing) ของ Wiz ที่ให้โมเดลวิเคราะห์ระบบเว็บที่ทำงานอยู่จริง Argon ทำได้ดีกว่าทั้งการสำรวจจุดที่ระบบเปิดรับการโจมตี (Attack Surface) การระบุช่องโหว่ และการสร้างหลักฐานพิสูจน์ (Proof-of-Concept) เพื่อยืนยันช่องโหว่นั้น
ความสามารถระดับนี้มาพร้อมความเสี่ยงที่สูงขึ้น ก่อนปล่อย Argon ในวงกว้าง Google จึงยังเสริมมาตรการป้องกันใน 4 ด้านหลัก
ด้านแรกคือการกันผู้ไม่หวังดีนำโมเดลไปใช้ก่อเหตุทางไซเบอร์ หรือภัยด้านเคมี ชีวภาพ รังสี และนิวเคลียร์ ตามกรอบความปลอดภัยของโมเดลแนวหน้า (Frontier Safety Framework) ของ Google โมเดลถูกออกแบบให้ปฏิเสธคำขอที่เป็นอันตราย แต่ยังรองรับงานวิจัยวิทยาศาสตร์ที่ชอบธรรมซึ่งนำไปใช้ได้ทั้งสองทาง (Dual-use) รอบนี้ Google ยกระดับเทคนิคเฝ้าดูการทำงานภายในของโมเดล (Internal Activations) เพื่อจับสัญญาณการใช้งานผิดวัตถุประสงค์ และให้ทีมทดสอบเจาะระบบ (Red Team) ทั้งภายในและภายนอกลองเจาะมาตรการเหล่านี้ ทั้งแบบใช้คนและแบบอัตโนมัติ
ด้านที่สองคือการรับมือการแฝงคำสั่งอันตรายทางอ้อม (Indirect Prompt Injection) ซึ่งผู้ไม่หวังดีซ่อนคำสั่งหรือบริบทอันตรายไว้ในข้อมูลที่โมเดลอ่าน เพื่อเข้าควบคุมพฤติกรรมของโมเดล การโจมตีแบบนี้ซับซ้อนและต้องป้องกันหลายชั้นตลอดเวลา Google ใช้การทดสอบเจาะระบบแบบอัตโนมัติร่วมกับการฝึกด้วยข้อมูลโจมตี (Adversarial Training) จน Argon เป็นโมเดลที่ทนทานต่อการโจมตีรูปแบบนี้มากที่สุดของบริษัท และนำบนชุดทดสอบ Indirect Prompt Injection ของ Gray Swan
ด้านที่สามคือการเฝ้าระวังพฤติกรรมที่เบี่ยงจากเจตนาของผู้ใช้ (Misalignment) เพื่อไม่ให้ Argon ทำเกินขอบเขตที่ผู้ใช้ตั้งใจเพียงเพื่อให้งานสำเร็จ Google ใช้ระบบติดตามลำดับความคิด (Chain-of-Thought) และการกระทำของโมเดล แล้วสั่งหยุดเมื่อจำเป็น ระบบลักษณะเดียวกันนี้ยังใช้เฝ้าดูระหว่างการฝึกโมเดล โดยส่งสัญญาณเตือนไปยังทีมรับมือเหตุการณ์โดยเฉพาะ และระวังไม่ให้ผลที่ตรวจพบย้อนกลับไปเป็นข้อมูลฝึก เพราะอาจทำให้โมเดลเรียนรู้วิธีคิดแบบหลบการตรวจจับ Google จึงเรียกร้องให้ทั้งอุตสาหกรรมรักษาความโปร่งใสของกระบวนการคิดของโมเดลไว้ในช่วงที่ความสามารถก้าวกระโดดเช่นนี้ เพื่อให้กระบวนการคิดยังใช้ระบุและวินิจฉัยปัญหาได้
ด้านสุดท้ายคือการเสริมความแข็งแรงให้ระบบ เมื่อโมเดลเก่งขึ้น สภาพแวดล้อมสำหรับทดสอบก็ต้องปลอดภัยตามทัน Google จึงแยกและปิดผนึกสภาพแวดล้อมจำลองแบบปิด (Sandbox) ก่อนเริ่มการฝึกหรือการประเมินที่มีความเสี่ยงสูง ตามแผนงานควบคุมเอเจนต์ของบริษัท และจะแบ่งปันแนวปฏิบัติด้านความปลอดภัยของเอเจนต์ให้พันธมิตร เพื่อยกระดับความปลอดภัยของทั้งระบบนิเวศ
Google ย้ำว่าการปล่อยความสามารถระดับนี้อย่างปลอดภัยต้องค่อย ๆ ขยายทีละขั้น ระหว่างนี้บริษัทเข้าร่วมกระบวนการแบบสมัครใจของรัฐบาลสหรัฐฯ ที่เปิดให้เข้าถึงโมเดลก่อนเปิดตัว และจะเก็บความเห็นจากผู้ทดสอบกลุ่มแรกไปปรับมาตรการป้องกัน ก่อนเปิดให้นักพัฒนา องค์กร และผู้ใช้ทั่วไปให้เร็วที่สุด โดยเริ่มจากลูกค้า API แบบเสียเงินและสมาชิก Google AI Ultra
ราคาช่วงเปิดตัวอยู่ที่ 2 ดอลลาร์ต่ออินพุต 1 ล้านโทเคน และ 10 ดอลลาร์ต่อเอาต์พุต 1 ล้านโทเคน ส่วนโทเคนอินพุตที่ดึงจากแคช (Cached Input) ลดราคา 95% จากราคาอินพุตปกติ ตอนนี้ Gemini 4 Argon ยังเปิดให้เฉพาะผู้เชี่ยวชาญด้านการป้องกันไซเบอร์ในโครงการ Fairwind Program และผู้ทดสอบที่ได้รับเชิญเท่านั้น
ที่มา: Google
ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด