ใน

ผู้เชี่ยวชาญด้านความปลอดภัย AI กังวล ระบบคิดใหม่ของ OpenAI Astra

เทคนิค “opaque recurrence” ในโมเดล Astra ของ OpenAI ผู้เชี่ยวชาญด้านความปลอดภัย AI กังวล ว่าอาจทำให้การตรวจสอบการให้เหตุผลของโมเดลยากขึ้น

ผู้เชี่ยวชาญด้านความปลอดภัย AI กังวล ระบบคิดใหม่ของ OpenAI Astra

มีรายงานว่าโมเดล Astra รุ่นใหม่ของ OpenAI จะใช้เทคนิคการให้เหตุผลที่เรียกว่า “recurrent depth” ซึ่งเปิดให้โมเดลประมวลผลแตกต่างจากกระบวนการคิดแบบเป็นลำดับ ที่พบในโมเดล Reasoning ส่วนใหญ่ ตามรายงานของ The Information

เทคนิคดังกล่าวมีอีกชื่อว่า “opaque recurrence” และอาจทำให้กระบวนการให้เหตุผลของโมเดล (Chain of Thought) ติดตามตรวจสอบได้ยากขึ้น จนสร้างความกังวลให้กับผู้เชี่ยวชาญด้านความปลอดภัย AI หลายราย

แม้มีรายงานว่า Astra จะใช้เทคนิคนี้ในระดับจำกัด แต่การนำเทคนิคมาใช้ก็ยังทำให้เกิดข้อกังวลอย่างมีนัยยะสำคัญ

ผู้เชี่ยวชาญกังวลกระบวนการให้เหตุผลของโมเดลอาจตรวจสอบได้ยากขึ้น

Buck Shlegeris ซีอีโอ Redwood ระบุหลังมีรายงานดังกล่าวว่า เขากังวลอย่างมากต่อข้อมูลที่ระบุว่า Astra ใช้ opaque recurrence

Shlegeris ระบุว่า ยังไม่ทราบแน่ชัดว่า Astra จะทำให้กระบวนการให้เหตุผลของโมเดลตรวจสอบได้ยากกว่าโมเดลก่อนหน้ามากน้อยเพียงใด แต่หาก OpenAI ผลักดันเทคนิคนี้ต่อไป บริษัทก็อาจเพิ่มการประมวลผลแบบ recurrence อย่างมากจนกระทบต่อความสามารถในการตรวจสอบ Chain of Thought

ด้าน Zvi Mowshowitz ผู้สนับสนุนด้านความปลอดภัย AI มาเป็นเวลานาน มองว่าอาจจำเป็นต้องมีกฎหมายเพื่อป้องกันไม่ให้ห้องปฏิบัติการ AI แข่งขันกันลดมาตรฐานด้านความปลอดภัย

Mowshowitz มองว่าเทคนิคดังกล่าวมีความเสี่ยงที่จะกระทบแนวทางที่ OpenAI และ Anthropic พยายามรักษาเอาไว้ นั่นคือการทำให้กระบวนการให้เหตุผลของโมเดล มีความสอดคล้องกับกระบวนการให้เหตุผลและสามารถตรวจสอบได้ให้นานที่สุด โดยหากมีการใช้เทคนิคประเภทนี้อย่างเข้มข้นมากขึ้น ก็อาจลดความสามารถในการตรวจสอบโมเดลลง

opaque recurrence แตกต่างจาก Chain of Thought แบบเดิมอย่างไร

ตามปกติ Chain of Thought ของโมเดล Reasoning จะแสดงขั้นตอนต่อเนื่องที่โมเดลใช้ในการพยายามแก้ปัญหา แม้ข้อมูลดังกล่าวจะไม่ได้สะท้อนกระบวนการให้เหตุผลจริงของโมเดลอย่างสมบูรณ์ แต่ก็ยังถือเป็นเครื่องมือที่มีประโยชน์ในการตรวจสอบพฤติกรรมที่ผิดปกติหรือปัญหาด้าน Alignment

ในกรณีกิจกรรมของ AI Agent ของ OpenAI ที่แสดงพฤติกรรมผิดไปจากที่คาดไว้ก่อนหน้านี้ บันทึก Chain of Thought ก็เป็นเครื่องมือสำคัญที่ช่วยวิเคราะห์ว่าเหตุใด Agent จึงมีพฤติกรรมในลักษณะดังกล่าว

แต่สำหรับ opaque recurrence โมเดลจะใช้แนวทางที่ไม่เป็นเส้นตรงมากนัก โดยประมวลผลคำถามเดียวกันหลายครั้งเป็นวงรอบ ส่งผลให้เหลือข้อมูลที่มนุษย์สามารถอ่านและติดตามได้ลดลง และอาจหลีกเลี่ยงการสร้างบันทึก Chain of Thought ในรูปแบบทั่วไป

OpenAI ย้ำ Astra ยังมี Chain of Thought ที่อ่านได้

อย่างไรก็ตาม มีรายงานว่าการใช้เทคนิคนี้ใน Astra ยังอยู่ในระดับจำกัด และ Chain of Thought ของโมเดลยังคาดว่าจะสามารถอ่านและตรวจสอบได้

OpenAI ยังปฏิเสธข้อเสนอแนะที่ว่าบริษัทกำลังจะเปลี่ยนไปใช้รูปแบบ neuralese และก่อนหน้านี้บริษัทได้ประกาศแผนสร้างระบบตรวจสอบ Chain of Thought อย่างครอบคลุมไว้เป็นส่วนหนึ่งของแนวทางด้านความปลอดภัยในอนาคตแล้ว

Jakub Pachocki หัวหน้านักวิทยาศาสตร์ของ OpenAI ระบุผ่านโพสต์บน X ว่า OpenAI พยายามรักษาและใช้ประโยชน์จากการตรวจสอบ Chain of Thought มาตั้งแต่ Reasoning Model รุ่นแรกของบริษัท และเรื่องนี้ยังเป็นหนึ่งในเป้าหมายหลักของงานวิจัยในปัจจุบัน

โมเดล AI ทุกตัวต่างก็มีกระบวนการให้เหตุผลที่ไม่สามารถสังเกตเห็นได้อยู่ในระดับหนึ่ง และนักวิจัยเพียงไม่กี่รายมองว่าบันทึก Chain of Thought เป็นตัวแทนโดยตรงของกระบวนการคิดที่แท้จริงของโมเดล

อย่างไรก็ตาม ข้อจำกัดดังกล่าวไม่ได้ทำให้ความกังวลเกี่ยวกับ opaque recurrence หายไป โดยเฉพาะความเป็นไปได้ที่เทคนิคนี้จะทำให้การตรวจสอบเหตุผลของ AI ยากขึ้น หากถูกนำไปใช้อย่างแพร่หลายในโมเดลต่าง ๆ

The Information รายงานเพิ่มเติมว่า Anthropic และ Google DeepMind ก็กำลังหารือเกี่ยวกับเทคนิคนี้แล้วเช่นกัน

กังวลโมเดลอาจย้ายการให้เหตุผลไปอยู่ใน latent space

Ryan Greenblatt หัวหน้านักวิทยาศาสตร์ของ Redwood Research ระบุว่า กระบวนการให้เหตุผลแบบ opaque recurrence อาจขยายขนาดได้เร็วกว่าการให้เหตุผลผ่าน Chain of Thought แบบเดิม และอาจนำไปสู่จุดที่กระบวนการให้เหตุผลทั้งหมดหายไปจากช่องทางที่มนุษย์สามารถมองเห็นได้

Greenblatt ระบุว่า สิ่งที่กังวลมากที่สุดคือ แนวทางตามธรรมชาติของเทคนิคนี้อาจนำไปสู่การขยายการให้เหตุผลแบบ opaque จนโมเดลประมวลผลเหตุผลทั้งหมดหรือเกือบทั้งหมดภายใน latent space

เขาหวังว่ายังไม่สายเกินไปที่จะหลีกเลี่ยงสถาปัตยกรรมที่สร้างความกังวลมากที่สุด และหวังว่า OpenAI จะหยุดการพัฒนาแนวทางนี้ไว้ในระดับปัจจุบัน

ที่มา: TechCrunch

ความคิดเห็น - Like เพจ iPhoneMod.net

เขียนโดย Krongkwun Rithiwong

Love exploring new technology. Decoding the future, one gadget at a time.