Worldmodeldata บริษัทสตาร์ทอัพจากอังกฤษ รวบรวมข้อมูลการควบคุมเกม มาเป็นชุดข้อมูลสำหรับการฝึก AI ที่ต้องเข้าใจโลกกายภาพมากขึ้น

Worldmodeldata สตาร์ทอัพสัญชาติอังกฤษ กำลังรวบรวมข้อมูลการควบคุมเกมของผู้เล่นจากสตูดิโอเกม ทั้งการโยกจอย การกดปุ่ม และภาพฉากสามมิติที่เปลี่ยนไปตามการกระทำนั้น มาจัดเป็นชุดข้อมูลสำหรับฝึก World Model หรือ AI ที่ถูกออกแบบให้เข้าใจและทำงานในโลกกายภาพได้

ทั้งนี้ Worldmodeldata ระบุว่า ได้รับสิทธิ์ใช้ข้อมูลแล้วเกือบหนึ่งล้านชั่วโมง อย่างไรก็ตาม นักวิจัยบางส่วน รวมถึงผู้นำทีมพัฒนาของ Nvidia ยังตั้งคำถามว่าฟิสิกส์ในเกมจะละเอียดพอสำหรับงานในโลกจริงหรือไม่

Worldmodeldata มองว่าข้อมูลการควบคุมที่สตูดิโอเกมเก็บไว้อยู่แล้วเป็นผลพลอยได้ที่มีอยู่ในปริมาณมหาศาล และสามารถนำมาใช้แก้ปัญหาการขาดแคลนข้อมูลฝึก World Model ได้ ปัจจุบันมีบางบริษัท เช่น General Intuition และ Niantic ที่เก็บข้อมูลเกมจากแพลตฟอร์มของตัวเองไปสร้างโมเดลแล้ว แต่ Worldmodeldata เลือกวางตัวเป็นตัวกลางที่คัดสรรและจัดระเบียบข้อมูลให้ ห้องแล็บ AI จึงไม่ต้องไล่ทำข้อตกลงกับสตูดิโอเกมจำนวนมากทีละราย

เรีย ลูคัส ซีอีโอของ Worldmodeldata กล่าวกับ WIRED ว่า ทุกวันนี้มีเกมดีๆ อยู่นับล้านเกม และเกมเหล่านี้ก็ใกล้เคียงโลกจริงมากขึ้นเรื่อยๆ เธอจึงตั้งคำถามว่าทำไมไม่นำประสบการณ์ที่หลากหลายและมีอยู่อย่างล้นเหลือในวิดีโอเกมมาสอน AI โดยในอนาคตบริษัทยังตั้งเป้าเปิดช่องทางให้ผู้เล่นแต่ละคนได้รับค่าตอบแทนด้วย

ลูคัสเชื่อว่าในท้ายที่สุด ข้อมูลจากวิดีโอเกมจะกลายเป็นวัตถุดิบส่วนใหญ่ในการฝึก World Model จากนั้นจึงนำโมเดลไปปรับแต่งด้วยข้อมูลเฉพาะของสภาพแวดล้อมหรืองานจริงแต่ละประเภท

แต่ไม่ใช่ทุกฝ่ายจะมองข้อมูลเกมในแง่ดี ยกตัวอย่างเช่น Nvidia ซึ่งเผยแพร่ World Model ที่ปรับแต่งให้ทำงานบนชิปของตัวเอง ผ่านการเลือกใช้เอนจิ้นที่พัฒนาขึ้นเองเพื่อจำลองฟิสิกส์ในโลกจริงโดยเฉพาะเป็นแกนหลักของ AI โดยหมิงอวี้ หลิว ผู้นำการพัฒนา World Model ของ Nvidia มองว่าโมเดลที่ฝึกจากข้อมูลการควบคุมเกมไม่น่าจะทำงานได้ดีกับงานที่ต้องควบคุมการเคลื่อนไหวอย่างละเอียด เช่น การหยิบจับวัตถุอย่างระมัดระวัง เพราะฟิสิกส์ในเกมมักแปลกประหลาด และนักพัฒนามักใช้ทางลัดเพื่อสร้างภาพลวงว่าสมจริง เช่น ตัวละครเอื้อมมือหยิบแอปเปิลจากโต๊ะ โดยไม่มีการเขียนโค้ดกำหนดรายละเอียดว่านิ้วแต่ละนิ้วต้องออกแรงกดเท่าใดเพื่อไม่ให้แอปเปิลหลุดมือ

ทางด้าน เซี่ยเทียน จู รองศาสตราจารย์ด้าน AI จากมหาวิทยาลัยเซอร์รีย์ มีข้อกังวลคล้ายกัน โดยระบุว่าวิดีโอเกมโดยเนื้อแท้แล้วคือเครื่องจำลองที่มีพื้นฐานทางฟิสิกส์อยู่ในระดับหนึ่ง แต่ยังหยาบมากและเป็นเพียงการประมาณเท่านั้น

ที่มาของแนวคิดนี้เกิดขึ้นจากความเชื่อที่กำลังเติบโตในบางกลุ่มของวงการ AI ว่า โมเดลภาษาขนาดใหญ่ (Large Language Model หรือ LLM) จะเจอกับข้อจำกัดในท้ายที่สุด เพราะเรียนรู้จากตัวอักษรเพียงอย่างเดียว และอาจไม่เหมาะกับงานที่ต้องอาศัยความแม่นยำและความละเอียดอ่อน เช่น การขับรถยนต์ไร้คนขับ เป็นต้น

ที่มา: Wired