OpenAI เผยข้อมูลความล้มเหลว ผ่านรายงานฉบับทางการ ถึงสาเหตุที่ AI Agent ของบริษัทสามารถเจาะระบบ Hugging Face มาจากระบบป้องกันที่หละหลวม
OpenAI เผยข้อมูลความล้มเหลว ที่นำไปสู่การเจาะระบบ Hugging Face
OpenAI ตกเป็นข่าวใหญ่ และก่อให้เกิดเสียงวิพากษ์วิจารณ์อย่างมากในเดือน ก.ค. หลังจากที่หนึ่งใน Agent ของบริษัทได้ดำเนินการโดยไม่ได้รับคำสั่ง เพื่อเจาะระบบของธุรกิจ AI เพื่อนร่วมวงการอย่าง Hugging Face และบริการอื่นๆ แม้ว่าก่อนหน้านี้ OpenAI จะได้แบ่งปันข้อมูลเชิงลึกบางส่วนเกี่ยวกับสิ่งที่นำไปสู่เหตุการณ์ดังกล่าวหลังจากที่ถูกค้นพบแล้ว วันนี้ทางบริษัทได้เผยแพร่รายงานอย่างเป็นทางการเกี่ยวกับสิ่งที่เกิดขึ้น
ในรายงาน ได้อธิบายถึงวิธีการที่ระบบต่าง ๆ ในระบบการฝึกฝนของ OpenAI ที่ล้มเหลว และพฤติกรรมใด ๆ ของ Agent ที่กำลังทดสอบอยู่ล้มเหลว
โมเดลที่เป็นปัญหาคือ Internal Model 1 หรือ IM1 เป็นตัวที่สามารถเข้าถึง Agent อื่น ๆ ของ OpenAI และสามารถเข้าถึงอินเทอร์เน็ตได้ ผ่านการจัดการ Artifactory package manager ที่ไม่ได้ตั้งใจ คล้ายว่า Agent ใช้ตรงนี้เป็นกระดานข้อความรูปแบบหนึ่ง

ซึ่งกิจกรรมนี้ ถูกตรวจพบครั้งแรกโดยผู้สังเกตการณ์ที่เป็นมนุษย์ในเดือน พ.ค. และ OpenAI ไม่ได้อณุญาตการเข้าถึงดังกล่าว แต่ถึงอย่างนั้น ตลอดเดือน พ.ค. – มิ.ย. Agent ต่าง ๆ ก็ยังคงใช้ประโยชน์จากช่องโหว่เพื่อเข้าถึงอินเทอร์เน็ต
ด้วยปริมาณ Agent ที่สามารถเข้าถึงเซิฟเวอร์นี้มีมากจนทำให้ระบบล้ม จนทีมงานต้องแก้ไขในช่วงต้นเดือน ก.ค. แต่ก็ไม่ได้รู้ว่า Agents ได้ดัดแปลงพื้นที่ตรงนี้จนเป็นเหมือนห้องแชทลับ ๆ ที่เอาไว้สื่อสารกัน
ดังนั้น เมื่อ IM1 ได้รับ มอบหมายให้ทำภารกิจที่ท้าทายความสามารถอย่าง ExploitGym ก็สามารถเข้าถึงอินเทอร์เน็ต และโมเดลอื่น ๆ ของ OpenAI ได้อีกครั้ง ในช่วงได้กี่วันในต้นเดือน ก.ค. เหล่า Agents ก็ได้ค้นหาวิธีแก้ปัญหาสำหรับความท้าทายนี้บนแพลตฟอร์มของ Hugging Face และ Modal ของเพื่อนร่วมวงการ
OpenAI กล่าวว่า ปัญหาหลักเกิดจาก reward hacking (อธิบายได้ประมาณว่า เป็นการพยายามทำให้ได้ผลลัพธ์แม้ว่าวิธีการไม่ถูกต้อง) ทำให้เกิดความรั้นในงานที่เหมือนจะทำไม่ได้, การสื่อสารที่ไม่ได้รับอนุญาต และการที่ Agents เอาเป้าหมายจากกันและกัน โดยมี Agents บางตัวที่ปฏิเสธเนื่องจากเหตุผลทางจริยธรรม แต่ Agents ตัวอื่น ก็ดำเนินการเจาะระบบแทนอยู่ดี
ซึ่งเมื่อมีการค้นพบ และการทดสอบที่ตามมาจะนำไปสู่ความปลอดภัยที่ดีขึ้น แม้ว่าในการทดสอบจะมีความเสี่ยงสูงก็ตาม แต่พฤติกรรมเหล่านี้ที่ไม่ดี ไม่ได้เกิดขึ้นเพียงจุดเดียว เมื่อเดือนที่แล้ว OpenAI มีเคสที่น่ากังวล ที่ AI Agents ก่อให้เกิดปัญหาด้านความมั่นคง ความปลอดภัยทางไซเบอร์ ไม่ว่าจะเป็นในการทดสอบหรือในการใช้งานปกติ หลังจากดำเนินการโดยไม่มีคำสั่งจากผู้ใช้ แต่อย่างไรก็ตาม ที่บางส่วนจากการเจาะระบบ Huggung Face ที่อาจจะช่วยบรรเทาความกลัวบางส่วนที่ว่า AI ได้หลุดการควบคุมไปแล้ว
พื้นฐานแล้ว เหตุการณ์นี้เกิดจากความล้มเหลวของมาตรการป้องกัน ไม่ได้เกิดจาก AI กำลังจะเข้าครอบงำทุกสิ่ง เพราะIM1 อยู่ในการตั้งค่าสำหรับการทดสอบที่มีการป้องกันอย่างจำกัด ซึ่งมีจุดประสงค์ เพื่อวิจัยมากกว่าสำหรับผลิตภัณฑ์ที่มีให้ใช้งานทั่วไป
อย่าไรก็ตาม นี่ก็เป็นอีกหนึ่งเครื่องเตือนใจ ว่าความไว้วางใจจำนวนมาก ตกใาอยู่ที่ บริษัท AI ที่บริษัท AI ที่จะต้องควบคุมและดูแลผลิตภัณฑ์ของตนอย่างเหมาะสม OpenAI ยอมรับในเรื่องนี้ โดยระบุว่าการกระทำล่าสุดของ Agents เป็น “หลักฐานที่แสดงให้เห็นว่า หากไม่มีมาตรการป้องกันที่เหมาะสม AI Agents ที่มีความสามารถสูงในขณะนี้ สามารถหาทางหลบเลี่ยงการควบคุมทางเทคนิค ร่วมมือกันผ่านช่องทางที่ไม่ได้รับการอนุมัติ และลงมือทำการที่อันตรายโดยไม่มีมนุษย์คนใดสั่งการ” แต่บริษัทและผู้นำของบริษัท ยังไม่สามารถพิศูจน์ได้ว่าพวกเขาควรได้รับความไว้วางใจนั้น
ที่มา: Engadget
