أخبار Odaily: عندما يتيح "برمجة الفايب" لمزيد من الأشخاص إنشاء تطبيقات باستخدام اللغة الطبيعية، تتحول المنافسة التالية لوكلاء الذكاء الاصطناعي إلى مشكلة أصعب: كيف يمكن إنجاز مهمة واقعية فعليًا عبر منصات وخدمات متعددة، تتضمن ميزانية وتفويضًا؟
في مقالها الأخير على Medium بعنوان "Beyond Vibe Coding, Toward Agentic Execution"، تستعرض X-Agent مثال "حجز رحلة إلى طوكيو" لتقديم اتجاه استكشافي للتنفيذ الوكيل (Agentic Execution): لم يعد المستخدم بحاجة إلى التنقل بين صفحات متعددة مثل تذاكر الطيران والفنادق والدفع، بل يبدأ المهمة بجملة واحدة، ويتولى الذكاء الاصطناعي تنسيق البحث والمقارنة والتأكيد والتنفيذ اللاحق؛ ويظل المستخدم مسيطرًا على الوجهة والميزانية والشروط والتفويض النهائي.
ولكن بين "اقتراح الحلول" و"التنفيذ الموثوق"، لا تزال هناك مجموعة كاملة من تحديات البنية التحتية. تتطلب تغيرات الأسعار، والتحقق من تسجيل الدخول، وانتهاء مهلة الطلبات، ونجاح الحجز الجزئي، أن يحتفظ الوكيل بحالة المهمة، وأن يميز بين النتائج المؤكدة وغير المؤكدة، وأن يتوقف ويطلب تفويض المستخدم مرة أخرى عند الحاجة، بدلاً من إعادة المحاولة بشكل أعمى أو الإنفاق التلقائي.
حول هذا الاتجاه، تقترح X-Agent تقسيم أربع قدرات رئيسية والتعاون فيما بينها: المحادثة، والمهام، والتنفيذ، والأحداث، وتستكشف مسارات تنفيذ مختلفة مثل WebMCP وAPI وأدوات MCP وأتمتة المتصفح واستخدام الكمبيوتر (Computer Use). المبدأ الأساسي هو: يمكن للأدوات مساعدة الوكيل على التصرف، ولكن لا يمكنها تجاوز أذونات المستخدم وقيود الميزانية والتحقق من النتائج.
صرحت X-Agent بأن المقال الحالي يصف اتجاهًا منتجيًا لا يزال قيد الاستكشاف والتحقق، وليس قدرة حجز عامة تم إطلاقها بالفعل. هدفها هو دفع الذكاء الاصطناعي من "الفهم والتوليد" إلى "إنجاز المهام تحت سيطرة المستخدم"، مما يجعل اللغة الطبيعية بوابة جديدة تربط الخدمات الواقعية بالتنفيذ الرقمي.