أطلقت Google نموذج Gemini 2.5 Computer Use، وهو إصدار متخصص من Gemini 2.5 Pro مصمم لمنح وكلاء الذكاء الاصطناعي تحكمًا مباشرًا في التطبيقات والمتصفحات. وبدلًا من الاعتماد فقط على واجهات برمجة التطبيقات المهيكلة، يتفاعل النموذج الجديد مع الواجهات الرسومية مثل النقر والكتابة والتمرير وحتى تعبئة النماذج كما يفعل الإنسان.

يعمل النموذج من خلال حلقة مستمرة في أداة computer_use الخاصة بـ Gemini API، حيث يحلل لقطات الشاشة والإجراءات الأخيرة قبل إصدار أمر واجهة المستخدم التالي. ويمكنه طلب تأكيد المستخدم للمهام الحساسة مثل عمليات الشراء، مما يضيف طبقة من الأمان.
Google تدّعي أن النموذج يتفوق على البدائل في السرعة والدقة معًا، لا سيما في اختبارات المتصفح، كما يُظهر وعودًا مبكرة في التحكم بتطبيقات الهاتف المحمول. ولتجنب سوء الاستخدام، يأتي مزوّدًا بضوابط صارمة مثل فحوصات السلامة لكل خطوة وإرشادات النظام التي يحدّدها المطورون.
أصبح Gemini 2.5 Computer Use متاحًا الآن في النسخة التجريبية العامة عبر Google AI Studio وVertex AI.
0 Comments
Leave a Reply