تفوق Photon-1 من Induction Labs على Google Gemini باستخدام قدرة حوسبة أقل بمقدار 30×

كشفت Induction Labs عن Photon-1 في 23 يوليو 2026، أول ما تسميه «نماذج الخيال»—فئة جديدة من تصميم البنية التحتية للتأسيس، مصممة للتعلم من الفيديو على مستوى الإنترنت دون أمثلة مُعلّمة أثناء مرحلة ما قبل التدريب. ويضم نموذج المحول (Transformer) ذي خبراء متفرقين (Sparse mixture-of-experts) بعدد 106 مليارات معامل، وبمقدار 5 مليارات معاملات فعّالة، وقد تم تدريبه على نحو 575 مليون إطار من تسجيلات شاشة الحاسوب، ما يعادل 18 عامًا من الفيديو تم أخذ عيناته بمعدل إطار واحد في الثانية. وتدّعي الشركة أن Photon-1 يتفوق على Gemini 3.1 Flash-Lite من Google في اختبارات داخلية لاستخدام الحاسوب، رغم أنه تم تدريبه على حوسبة أقل بما لا يقل عن 30 مرة، مع تكلفة أقل بنحو 3 مرات لكل مليون رمز عند تقديم الخدمة بسعر 0.11 دولار مقارنةً بـ 0.36 دولار لدى Gemini. ويواجه هذا النموذج افتراضًا راسخًا في مجال الذكاء الاصطناعي: أن تعليم الآلات التصرف يتطلب أمثلة مُعلّمة بدقة لكل إجراء ينبغي أن تقوم به. وتزيل مقاربة Induction Labs عنق زجاجة حاسمًا عبر تمكين الآلات من تعلم المعرفة الإجرائية بمجرد مراقبة فيديو غير مُعلّم لواجهات الحاسوب أثناء استخدامها.

نماذج الخيال: ضغط العملية وتعديلها بدقة (Finetuning)

إن تحويل المعرفة الرصدية إلى وكيل يعمل يتطلب مرحلة ثانية. فقد قامت Induction Labs بعمل finetuning لـ Photon-1 على أقل من 35,000 مسار مُعلّم لاستخدام الحاسوب لتتعلمه صيغة الإجراء الصحيحة، مع إضافة رموز خاصة تُمكّن النموذج من إصدار أوامر لوحة المفاتيح والماوس. وعند الاستدلال، يعمل النظام على خطوتين: إذ يتخيل أولًا الحالة التالية التي من شأنها دفع المهمة إلى الأمام، ثم يولّد الإجراء المقصود للوصول إلى تلك الحالة. وتلتها تعلم تعزيزي عبر الإنترنت، مع عمليات تنفيذ (rollouts) آنية على آلات افتراضية تعمل بنظام Linux عبر خمس بيئات سطح مكتب، والتحقق من النتائج بشكل برمجي، وإشارات المكافأة التي تقود التحسينات الإضافية. وعند ضبطه على 20,000 مباراة من الشطرنج/اللعبة الشطرنجية (checkers) بنظام بطولات، تفوق Photon-1 على أساس رؤية (vision-encoder) وعلى نموذج لغوي مماثل الحجم (language model) في كل من محاكاة العالم وجودة النقلات. كما حقق، عند التدريب على 10,000 لعبة بلياردو تم توليدها اصطناعيًا، متوسط خطأ مطلق قدره 0.47 في التنبؤ بموقع الكرة، مقارنةً بـ 1.15 لخط أساس نموذج LLM و1.44 لخط أساس الرؤية. كما اكتسب النموذج أنماط سلوك بشرية من بيانات ما قبل التدريب، وتعلم توجيه (prompt) نسخة شبيهة بـ ChatGPT داخل آلة افتراضية، والتحقق من مخرجاتها، وتوجيه المحادثة حتى اكتمال المهمة.

تطورات نماذج العالم في 2026

يأتي Photon-1 في لحظة يتجه فيها قطاع صناعة الذكاء الاصطناعي إلى ما يسميه الباحثون على نطاق واسع «نماذج العالم»—وهي أنظمة تبني تمثيلات داخلية لكيفية تطور البيئات استجابةً للأفعال، لا مجرد التنبؤ بالنص أو توليد لقطات فيديو منفصلة. في مايو، أطلقت Google DeepMind Genie 3، وهو نموذج عالم تفاعلي تَرَكيبي (interactive) يعمل في الزمن الحقيقي وقادر على توليد بيئات ثلاثية الأبعاد مستمرة بمعدل 24 إطارًا في الثانية من نص أو صور، مع فيزياء يتعلمها من تلقاء نفسه بدلًا من قواعد مُمَرمزة (hard-coded). وقد تجاوزت منصة Cosmos التابعة لـ NVIDIA—التي تقدم نماذج أساس مفتوحة الأوزان (open-weight world foundation models) تم تدريبها على 20 مليون ساعة من بيانات واقعية—مليونَي تنزيل، ويتم تبنيها لدى شركات روبوتات بما في ذلك 1X وFigure AI وAgility لتوليد بيانات تدريب اصطناعية. كما أطلقت World Labs التابعة لـ Fei-Fei Li Marble، وهو نظام متاح تجاريًا لإنشاء عوالم ثلاثية الأبعاد قابلة للتعديل من نص أو صور أو فيديو. بينما جمعت AMI Labs التابعة لـ Yann LeCun—ويُقال إنها قُدِّرت قيمتها بـ 3 مليار يورو قبل إطلاق منتج—مبلغ 500 مليون يورو لملاحقة بنى بأسلوب JEPA تتعلم تمثيلات مجردة عبر التنبؤ في فضاء كمون بديل عن وحدات البكسل. وتشمل التطورات البارزة الأخرى Gen-4.5 من Runway، إذ تصف الشركة صراحةً بأنه «نموذج عالم» مع فيزياء واقعية، وDreamZero، وهو نموذج عمل/أفعال عالم (world action model) يتضمن 14 مليار معامل، أظهر نقلًا قويًا عبر تجسيدات (cross-embodiment transfer) من فيديو بشري إلى التحكم بالروبوت باستخدام معلومات بصرية فقط دون تسميات أفعال.

الأسئلة الشائعة

ماذا كشفت Induction Labs في 23 يوليو 2026؟

كشفت Induction Labs عن Photon-1، أول «نموذج خيال»—محول (Transformer) خبراء متفرق (sparse mixture-of-experts) بعدد 106 مليارات معامل، وبـ 5 مليارات معاملات فعّالة، تم تدريبه على نحو 575 مليون إطار من تسجيلات شاشة حاسوب غير مُعلّمة. يتعلم النموذج استخدام الحاسوب عبر مشاهدة الفيديو دون تسميات إجراءات أثناء ما قبل التدريب.

كيف تقارن أداء Photon-1 بأداء Google Gemini 3.1 Flash-Lite؟

تزعم Induction Labs أن Photon-1 يتفوق على Gemini 3.1 Flash-Lite من Google في اختبارات داخلية لاستخدام الحاسوب، رغم أنه تم تدريبه على حوسبة أقل بما لا يقل عن 30 مرة. وتُبلغ الشركة عن تكلفة استدلال قدرها 0.11 دولار لكل مليون رمز مقارنةً بتكلفة Gemini البالغة 0.36 دولار. والاختبار داخلي وغير منشور، وتقدير حوسبة Gemini هو توقع تقديري من Induction Labs.

ما تطورات نماذج العالم التي حدثت في 2026؟

في مايو، أطلقت Google DeepMind Genie 3، وهو نموذج عالم تفاعلي يعمل في الزمن الحقيقي ويولّد بيئات ثلاثية الأبعاد مستمرة بمعدل 24 إطارًا في الثانية. وتجاوزت منصة Cosmos التابعة لـ NVIDIA مليونَي تنزيل، ويتم تبنيها لدى شركات روبوتات بما في ذلك 1X وFigure AI وAgility. وقد أطلقت World Labs التابعة لـ Fei-Fei Li Marble لإنشاء عوالم ثلاثية الأبعاد قابلة للتعديل. وجمعت AMI Labs التابعة لـ Yann LeCun 500 مليون يورو لمتابعة بنى بأسلوب JEPA.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة مستمدة من مصادر خارجية وهي للمرجعية فقط. لا تمثل هذه المعلومات آراء أو وجهات نظر Gate ولا تشكل أي نصيحة مالية أو استثمارية أو قانونية. ينطوي تداول الأصول الافتراضية على مخاطر عالية. يرجى عدم الاعتماد حصرياً على المعلومات الواردة في هذه الصفحة عند اتخاذ القرارات. لمزيد من التفاصيل، يرجى الرجوع على إخلاء المسؤولية.
تعليق
0/400
لا توجد تعليقات