
OpenAI เพิ่งออกมาประกาศว่า พวกเขาตรวจพบ และได้สกัดกั้นปฏิบัติการหมู่ที่พยายามดึง 'Protected Reasoning' หรือการดึงกระบวนการความคิดภายในของโมเดลออกมา โดยปฏิบัติการครั้งนี้เริ่มตั้งแต่ช่วงต้นเดือนกรกฎาคม ก่อนจะพุ่งขึ้นอย่างมากในช่วงปลายเดือนเดียวกัน
OpenAI ระบุว่า กลุ่มคนหลัก ๆ ในปฏิบัติการครั้งนี้ มีความเชื่อมโยงกับบุคคลที่เกี่ยวข้องกับ Moonshot AI บริษัทผู้พัฒนา Kimi แต่ยังไม่สามารถยืนยันได้
สิ่งที่น่าสนใจคือ ผู้ดำเนินการไม่ได้แฮกระบบ ไม่ได้เจาะฐานข้อมูล และไม่ได้เข้าถึงบทสนทนาที่ OpenAI เก็บไว้ แต่ใช้การโต้ตอบกับโมเดลเพื่อพยายามทำให้ AI เปิดเผย Reasoning ที่ปกติถูกซ่อนไว้
โดยปกติแล้ว โมเดล AI แบบ Reasoning ไม่ได้แสดงกระบวนการการคิดทั้งหมดให้ผู้ใช้เห็น แม้จะมีการแสดงให้เห็นบางส่วนว่าขณะนี้โมเดลกำลังทำอะไร โดยใช้หลักการคิดอะไรอยู่ก็ตาม
ในระบบ API บางประเภท Reasoning เหล่านี้จะถูกเก็บอยู่ในรูปของข้อมูลเข้ารหัสที่ผู้ใช้อ่านไม่ได้ แต่สามารถส่งกลับไปพร้อมคำขอครั้งถัดไป เพื่อให้โมเดลทำงานต่อจากบริบทเดิมได้
ก่อนหน้านี้เคยมีงานวิจัยพบว่า Reasoning ที่เข้ารหัสในบางระบบ สามารถนำกระบวนการคิดนี้ไปใช้ข้ามเซสชัน ใช้ข้าม User หรือแม้แต่นำไปใช้ข้ามโมเดลบางรุ่นในผู้ให้บริการเดียวกันได้
ในการทดลอง นักวิจัยนำก้อน reasoning จากโมเดลที่มีความสามารถสูง ไปให้โมเดลที่เล็กกว่าและมีมาตรการป้องกันน้อยกว่าประมวลผล จากนั้นพยายามให้โมเดลตัวหลังถอด Reasoning ออกมาเป็นข้อความที่อ่านได้
ตามลำดับเหตุการณ์ของ OpenAI กิจกรรมเริ่มขึ้นตั้งแต่วันที่ 1 กรกฎาคมในระดับต่ำ ก่อนจะเพิ่มขึ้นอย่างมากในวันที่ 24 และ 25 กรกฎาคม
ภายในสองวัน OpenAI ตรวจพบ request ประมาณ 16,000 ครั้งที่มีรูปแบบเกี่ยวข้องกับการสกัด Reasoning จากผู้ใช้มากกว่า 4,000 ราย
เมื่อขยายการตรวจสอบต่อ บริษัทพบกิจกรรมที่ใช้ prompt รูปแบบใกล้เคียงกันในกลุ่มผู้ใช้มากกว่า 15,000 ราย และระบุว่าสามารถสกัดกั้นกิจกรรมกลุ่มนี้ได้ทั้งหมดภายในวันที่ 28 กรกฎาคม
อย่างไรก็ดี OpenAI ไม่ได้เปิดเผยว่ามี reasoning ถูกสกัดออกไปจริงมากน้อยเพียงใด และความพยายามกว่า 16,000 ครั้งนี้ก็ไม่มีการเปิดเผยว่าสามารถดึง Reasoning ออกมาได้สำเร็จจริงห
OpenAI ระบุว่า ยังไม่ทราบแน่ชัดว่าผู้ดำเนินการทั้งหมดที่พบในช่วงเวลาดังกล่าวมาจากรายเดียวกันหรือไม่ แต่อ้างว่ากลุ่มหลักของปฏิบัติการรอบนี้น่าจะมีความเกี่ยวข้องกับ Moonshot AI ผู้พัฒนา Kimi จากจีน
กล่าวอีกมุมคือ OpenAI พยายามเจาะจงไปที่ตัวบุคคลที่มีความเกี่ยวข้องกับบริษัท มากกว่าระบุว่า Moonshot AI เป็นผู้อยู่เบื้องหลังปฏิบัติการครั้งนี้
ในตอนนี้ยังไม่มีคำชี้แจงออกมาจาก Moonshot AI ต่อข้อกล่าวหาดังกล่าวแต่อย่างใด
OpenAI มองว่าความเสี่ยงไม่ได้อยู่เพียงการเปิดเผยว่าโมเดล คิดอย่างไร แต่ reasoning เหล่านี้อาจถูกนำไปใช้เพื่อฝึกหรือพัฒนาโมเดลอื่นต่อได้
กระบวนการที่นำ output หรือ reasoning ของโมเดลหนึ่งไปใช้ฝึก ทำซ้ำ หรือเพิ่มความสามารถให้อีกโมเดลอย่างเป็นระบบโดยไม่ได้รับอนุญาต เรียกว่า adversarial distillation โดย OpenAI มองว่าการกระทำแบบนี้มีความเสี่ยงสองด้าน
ด้านแรก หาก reasoning ถูกนำไปใช้ฝึกโมเดลอื่น ความสามารถบางอย่างอาจถูกถ่ายทอดไปโดยไม่ได้รักษามาตรการความปลอดภัยแบบเดียวกับโมเดลต้นทาง
อีกด้านคือ หากทำในสเกลใหญ่ ผู้พัฒนารายอื่นอาจพัฒนาความสามารถของโมเดลขั้นสูงได้รวดเร็วขึ้น โดยไม่ต้องลงทุนด้านการพัฒนา และความปลอดภัย
OpenAI ระบุว่าได้ใช้มาตรการหลายด้านเพื่อรับมือเรื่องดังกล่าวแล้ว
อย่างไรก็ดี OpenAI บอกว่างานนี้ยังไม่จบ เพราะหนึ่งในปัญหาคือโมเดลที่ให้บริการผ่าน infrastructure ของพันธมิตรจำเป็นต้องมีมาตรการป้องกันในระดับเดียวกับบริการที่ OpenAI ดูแลเอง
อีกจุดคือการโจมตีผ่านผลลัพธ์จากเครื่องมือ หรือ tool output ซึ่งซับซ้อนกว่าการตรวจข้อความธรรมดาที่ผู้ใช้มองเห็น
OpenAI คาดว่าความพยายามทำ adversarial distillation จะซับซ้อนขึ้นเรื่อย ๆ เมื่อโมเดล frontier มีความสามารถสูงขึ้น และมีแรงจูงใจให้ผู้เล่นรายอื่นหาวิธีเลียนแบบความสามารถเหล่านั้นด้วยต้นทุนที่ต่ำกว่า
อ้างอิง : https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign/
เตรียมความพร้อมให้ธุรกิจของคุณก้าวสู่ยุค AI อย่างมั่นใจ ด้วยการพัฒนา people, process และ technology อย่างครบวงจรไปกับ Techsauce
ร่วมสำรวจแนวทางและโอกาสในการเปลี่ยนผ่านสู่ AI-first organization ไปกับเรา Techsauce
เพื่อนร่วมทางในการพัฒนา AI journey ของคุณ ได้ที่: https://services.techsauce.co/contact-us
หรืออีเมล [email protected]
ลงทะเบียนเข้าสู่ระบบ เพื่ออ่านบทความฟรีไม่จำกัด