مقالة تحليلية مبنية على مصادر مفتوحة حتى 22 سبتمبر 2026. ليست تحقيقًا جنائيًا مستقلًا، ولا اختبارًا جديدًا لمنظومة سلاح، ولا بحثًا محكّمًا.

مسار الدليلسُلّم الدليل من الرصد إلى النتيجة
  1. 1

    استخدام مرصود

  2. 2

    مخرج مُنتَج

  3. 3

    تحقق مستقل

  4. 4

    نتيجة مقبولة

كل درجة تحتاج دليلًا إضافيًا؛ وجود الاستخدام أو المخرج لا يثبت وحده جودة النتيجة أو صلاحيتها التشغيلية.

تنزيل PDFالنسخة البحثية الكاملة بالعربية10 صفحات · الحجم: 383 KB
في هذه المادة

ثلاث نوافذ ومشكلة ليست افتراضية

في الحالة التي وثقتها أنثروبيك في شمال اليمن، شغّلت مجموعة عدة نسخ من كلود في وقت واحد: واحدة تكتب، وأخرى تبحث، وثالثة تراجع. يبدو الترتيب مألوفًا لأي فريق جرّب الوكلاء الذكيين، إلى أن نصل إلى طبيعة المشروع: قالت أنثروبيك إن العمل تعلق ببرمجيات ضمن برامج لتطوير أسلحة موجهة. لم يكن سؤالًا عابرًا في نافذة محادثة، بل سير عمل هندسي استُخدم فيه Claude Code في أجزاء كانت تحتاج عادة إلى عمل بشري متخصص. 1

هنا تبدأ القصة التي تستحق القراءة. ليست قصة «روبوت محادثة صنع صاروخًا»؛ فهذه جملة ممتازة للعناوين ورديئة للتحليل. وليست قصة فشل يسمح لنا بإغلاق الملف؛ لأن الفشل قد يكون نهاية محاولة، وقد يصبح أيضًا معلومة تدخل في المحاولة التالية. القصة الأدق أن نموذجًا لغويًا دخل حلقة من الكتابة والمحاكاة والمراجعة والاختبار، ثم بقي السؤال الحاسم معلقًا: ماذا أضاف فعلًا؟

تقول أنثروبيك إن اختبار إطلاق بدا فاشلًا، وإن المستخدمين عادوا إلى الخدمة لتحليل ما حدث. وتقول بالوضوح نفسه إنها لا تملك دليلًا على نجاحهم في نشر منظومة تشغيلية. الجملتان يجب أن تبقيا معًا. الأولى تمنعنا من وصف النشاط بأنه فضول نظري، والثانية تمنعنا من ترقية محاولة مرصودة إلى قدرة ميدانية ناجحة. 1

تغري هذه الوقائع الكاتب بصورة غرفة سرية تتولى فيها الآلة كل شيء. لكن الصورة تخفي أكثر مما تكشف: لا نرى من التقرير سلسلة التوريد، ولا الخبرة السابقة للمستخدمين، ولا الأعمال البشرية التي أحاطت بالمنصة، ولا معايير قبول المخرجات. ما نراه مهم، لكنه جزء من مشروع لا المشروع كله. لذلك يبدأ التحليل من مقاومة فعل واحد مثل «صنع» أو «طوّر» حين يحمل داخله عشرات الخطوات التي لم تُرصد بالمستوى نفسه.

ما الذي نعرفه، وما الذي لا نملكه؟

المصدر الأول هو شركة رأت نشاطًا داخل خدمتها. هذه نافذة مهمة: تستطيع الشركة وصف الحسابات، وتسلسل الطلبات، وبعض الملفات والمخرجات التي مرت عبر منصتها. لكنها ليست تحقيقًا مستقلًا في أداء سلاح على الأرض. لا تخبرنا سجلات الاستخدام وحدها إن كان الكود صحيحًا، أو إن كان العتاد مناسبًا، أو إن كانت المنظومة ستصمد في بيئة تشغيلية حقيقية. 1

وهناك قيد آخر في الإسناد. سمّت أنثروبيك الخلية وحددت موقعها في شمال اليمن، لكنها لم تعلن أنها تابعة للحوثيين. ربطت تغطيات صحفية الحالة بالجماعة استنادًا إلى السيطرة الجغرافية والسياق، ونقلت أسوشيتد برس ردًا من عضو في مكتبها السياسي ينفي منطق الاعتماد على المصادر المفتوحة لبناء القدرة العسكرية. هذا الربط السياقي يستحق الذكر، لكنه لا يتحول بالتكرار إلى تعريف تنظيمي مؤكد. 2

التمييز هنا ليس تمرينًا في الحذر اللغوي. إذا أخطأنا في هوية الفاعل فسنبني تحليلًا سياسيًا على أساس غير مثبت. وإذا أخطأنا في وصف النتيجة فسنتعامل مع اختبار فاشل كأنه إعلان جاهزية. وإذا بالغنا في مقدار مساهمة الأداة فسننسب إليها معرفة ومكونات وخبرة سابقة لم تنشأ في لحظة فتح الحساب. البحث الجيد يبدأ بوضع كل ادعاء داخل حدود النافذة التي أنتجته.

لهذا أفضّل سجلًا بسيطًا للادعاءات على كومة كبيرة من الروابط. في السجل نسأل: من قال ماذا، ومتى، وبأي وصول إلى الواقعة، وما الذي لا يستطيع المصدر رؤيته؟ قد تكون الشركة أفضل مصدر لوصف حسابها، والصحفي أفضل مصدر لرد طرف سياسي، والتقرير الأممي أفضل مصدر لتقييم فريق الخبراء. لا ينتقص اختلاف النوافذ من قيمة المصادر؛ بل يمنع مصدرًا قويًا في مجال من أن يتحول خطأً إلى سلطة مطلقة في كل المجالات.

المهم ليس النص، بل الحلقة

لا تكمن أهمية الحالة في أن النموذج كتب أسطرًا من الكود. الكود أصبح سلعة متاحة منذ عقود، والمكتبات المفتوحة والكتب الجامعية لم تكن سرًا. الجديد المحتمل هو أن تتجمع أعمال البحث والكتابة والمقارنة والمراجعة داخل واجهة واحدة وبسرعة مختلفة، وأن يستطيع المستخدم توزيعها على أكثر من وكيل. هذا لا يلغي الحاجة إلى المهندس، لكنه قد يغيّر موضع الندرة في المشروع.

يمكن تصور المسار في صورة عامة: مشكلة محددة، ثم مخرج برمجي، ثم اختبار مستقل، ثم قرار بقبول النتيجة أو رفضها. الخلل يبدأ حين نخلط بين هذه الدرجات. وجود مخرج لا يعني أنه اجتاز اختبارًا؛ واجتياز اختبار محدود لا يعني أنه يعمل في الواقع؛ والوصول إلى نتيجة مقبولة مرة لا يثبت أن العملية أصبحت موثوقة. لهذا تأتي قيمة السلم المفاهيمي المرفق بهذه المقالة: الرصد، ثم المخرج، ثم التحقق، ثم النتيجة المقبولة.

أعلنت أنثروبيك أنها أغلقت الحسابات المرتبطة بالنشاط، لكنها قالت أيضًا إن المستخدمين كانوا قد أنشؤوا حزمة محاكاة محلية. بقاء الأداة المحلية لا يثبت أنها نافعة أو دقيقة، لكنه يوضح فرقًا جوهريًا: يمكن إنهاء جلسة سحابية، ولا يمكن افتراض استرجاع كل ما خرج منها. إغلاق المنفذ إجراء أمني مهم؛ أما قياس أثره فيحتاج أن نعرف ما الذي توقف، وما الذي بقي، وكيف استُخدم لاحقًا. 1

هذه الحلقة هي موضع التحول المحتمل. حين يصبح الانتقال من سؤال إلى مسودة، ومن مسودة إلى مراجعة، أسرع، قد تتغير شهية المستخدم للتجريب حتى لو لم يتغير احتمال النجاح في كل محاولة. لكن التسارع المفترض لا يُقاس بعدد الرسائل أو بطول الملف. يُقاس بزمن كامل، وجودة محددة، وكلفة مراجعة، ونتيجة تستطيع جهة أخرى رفضها. من دون ذلك نعرف أن العمل تحرّك، ولا نعرف ما إذا كان قد تقدّم.

التاريخ لم يبدأ مع نافذة المحادثة

إذا صح الربط السياقي بالحوثيين، فإن النموذج لم يدخل فراغًا تقنيًا. توثق تقارير الأمم المتحدة سجلًا طويلًا من إطلاق الصواريخ والمسيّرات على السعودية، كما توثق هجمات على مطار أبها ومنشآت مدنية واقتصادية. وتوضح تقارير لاحقة أن أزمة البحر الأحمر نقلت أثر العمليات إلى الملاحة وسلاسل الإمداد. ليست هذه الوقائع دليلًا على أن خلية أنثروبيك هي الجهة نفسها، لكنها تفسر لماذا لا يمكن قراءة الحالة بوصفها تجربة برمجية معزولة. 9 10 11

وفي 19 سبتمبر 2026 أعلن الحوثيون هجمات على الرياض وينبع، بينما قالت قوات التحالف إنها اعترضت صاروخًا متجهًا إلى الرياض وأحبطت هجمات أخرى. بقي نجاح الضربات والأضرار المزعومة محل روايات متعارضة. قيمة هذا المثال ليست في ربطه بكلود؛ لا يوجد مصدر يثبت علاقة سببية بينهما. قيمته أنه يضع النقاش في منطقة تعرف أثر الإنذار والتعطيل والاعتراض، لا في مسرح افتراضي. 6

السياق إذن يرفع أهمية السؤال، لكنه لا يجيب عنه. وجود قدرة قائمة لا يثبت أن الذكاء الاصطناعي حسّنها. ووجود دعم خارجي موثق في تقارير أممية لا يثبت أن كل عملية تدار من الخارج أو أن كل خلية تنتمي إلى البنية نفسها. القدرة شبكة من الخبرة والمكونات والاختبار واللوجستيات والقرار؛ وأي تحليل يختزلها في أداة واحدة يفقد الشيء الذي يريد قياسه. 12

وفي سبتمبر 2026 كان برنامج الأغذية العالمي يوسع استجابته في اليمن مع تجدد القتال والنزوح. لا يثبت هذا التزامن علاقة بحالة كلود، ولا أضعه هنا ليؤدي وظيفة سببية لا يملكها. أضعه لأن أثر النزاع لا ينتهي عند مقارنة مواصفات سلاحين؛ يصل إلى الموانئ والمطارات والغذاء وقدرة الناس على البقاء. حين نناقش خفض كلفة المحاولة التقنية، ينبغي ألا تختفي الكلفة البشرية خلف براعة المصطلحات. 4

الصاروخ لا يرى العالم وحده

يميل النقاش العام إلى النظر إلى الجسم الطائر وحده، كأن الدقة صفة داخل قطعة معدنية. أما القدرة التشغيلية فتحتاج إلى معلومات عن الهدف، ووسائل رصد، واتصال، وقيادة، واختبار، وصيانة. وثقت تقارير أممية وبيانات عسكرية وجود رادارات ومعدات اتصال ضمن البنية الحوثية أو ضمن شحنات قالت الجهات المعلنة إنها كانت متجهة إليها. وتظل هذه المصادر متفاوتة في نوع دليلها وحدود ما تثبته. 12 13 16

تتضح المسألة حين ننظر إلى جودة المعلومات وتوقيتها: قد تصل المعلومة متأخرة، وقد يكون الرصد ناقصًا، وقد يغيّر التشويش والطقس وحركة الهدف جودة القرار. البرنامج الممتاز لا يعوض مدخلات رديئة، والمستشعر الجيد لا يصلح تلقائيًا سلسلة قرار ضعيفة. النجاح، إن حدث، هو خاصية منظومة لا شهادة امتياز لمكوّن واحد.

لهذا لا تسمح لنا الحالة المنشورة بالقول إن برنامج كلود اتصل برادار أو حسّن استهدافًا فعليًا. لا يوجد هذا الدليل في المواد التي راجعتها. ما تسمح به هو سؤال أكثر تواضعًا: هل أصبح إنتاج بعض المكونات المعرفية للمنظومة أسرع أو أرخص؟ وإذا كان الجواب نعم، فهل بقي التحقق والعتاد والتكامل هي القيود الأثقل؟ هذه أسئلة قياس، لا دعوة إلى استكمال التفاصيل المفقودة.

من «شمعون» إلى اقتصاد الخبرة

بالنسبة إلى السعودية، لا يبدأ تقاطع التقنية والأمن القومي في 2026. يقول التقييم اللاحق لـUnit 42 إن حملة «شمعون» في 2012 أضرت بثلاثين ألف نظام أو أكثر، ثم وثقت الشركة عودة نسخة محدثة في استهداف سعودي عام 2016. تختلف درجات الإسناد بين التحقيقات والتقييمات التقنية، ولذلك يجب إبقاء الفرق بين تقدير شركة أمنية، وموقف حكومي، وحكم قضائي. الثابت في هذا السجل أن البرمجيات عطلت نظمًا رقمية تعمل عليها مؤسسات كبيرة؛ وهو أثر ينبغي تمييزه عن توقف الإنتاج الصناعي نفسه. 18

بعد ذلك وثقت شركات وجهات حكومية حملات تجسس مرتبطة بإيران أو منسوبة إلى عناصر تابعة لها، استهدفت قطاعات الطاقة والطيران والبحث. وفي أغسطس 2026 أعلنت وزارة العدل الأمريكية لائحة اتهام بديلة موسعة ضد سبعة عشر عضوًا في معهد مبنا، بينهم تسعة سبق اتهامهم عام 2018. ما ورد في اللائحة ادعاءات قضائية لا أحكام إدانة، وهذه العبارة ليست تحفظًا شكليًا؛ إنها الفرق بين خبر عن اتهام وخبر عن ذنب ثبت أمام القضاء. 7 19

يجمع هذا التاريخ خيط واحد: المعرفة التقنية نفسها جزء من ساحة المنافسة. كانت البرمجيات وسيلة للتخريب أو التجسس، ثم أصبحت المنصات الذكية أيضًا مكانًا قد تُطلب فيه المساعدة على بناء قدرة جديدة. لذلك يتسع سؤال الدفاع من «من دخل شبكتي؟» إلى «ما الذي ساعدت منصتي مستخدمًا على إنتاجه؟». لا يحل السؤال الجديد محل القديم، لكنه يضيف طبقة لا تستطيع أدوات المراقبة التقليدية رؤيتها كاملة.

وفي اليمن نفسه وثقت Recorded Future نشاط OilAlpha، ووصفتها بأنها مجموعة يُرجح أنها مؤيدة للحوثيين، مع حملات استهدفت موظفين مرتبطين بمنظمات إنسانية وحقوقية. هذا تقييم شركة أمنية عن مجموعة أخرى، ولا يثبت أنها خلية أنثروبيك. لكنه يوسع معنى الأصل الحساس: قد لا يكون مخطط منشأة؛ قد يكون هاتف موظف إغاثة أو بيانات دخوله. كما أن الاستهداف أو الانتحال لا يثبت اختراق الأنظمة المركزية للمنظمة. 20

هل صنع الذكاء الاصطناعي القدرة؟

عبارة «عزّز الذكاء الاصطناعي القدرة» ناقصة ما لم نحدد معنى التعزيز. هل قلل زمن مهمة؟ هل خفض الحاجة إلى ساعات من خبير نادر؟ هل زاد عدد المحاولات؟ هل حسّن جودة النتيجة؟ أم منح المستخدم ثقة أكبر فقط؟ هذه نتائج مختلفة، ويمكن أن تتحرك في اتجاهات متعارضة. قد تزداد سرعة إنتاج المسودة بينما تزيد كلفة مراجعتها، وقد تتسع التجارب من دون أن تتحسن نسبة النجاح.

المشكلة أن الواقعة تعطينا مسارًا واحدًا: ما حدث مع الأداة. لا تعطينا العالم البديل نفسه من دونها. لذلك لا نستطيع طرح زمنين وادعاء مقدار دقيق للإضافة. أنثروبيك تعرض الحالة بوصفها مثالًا على رفع القدرة، لكنها تقر في بحثها المصاحب بأن الاختبارات والمحاكاة لا تقيسان مباشرة مقدار الأثر في العالم، وأن الانتقال إلى العتاد يبقى قيدًا جوهريًا. 24

القراءة التي أجدها أكثر اتساقًا مع الأدلة هي أن الأداة قد تخفض احتكاك بعض العمل الرمزي: البحث، والكتابة، والمقارنة، والتكرار. وهذا قد يجعل المحاولة أرخص حتى إذا لم يجعل النجاح مضمونًا. في الأمن القومي، انخفاض كلفة الدورة التالية مسألة مهمة بذاتها؛ لكنه لا يساوي امتلاك منظومة موثوقة، ولا يسمح لنا بإعلان أن المهندس اختفى.

لنتخيل مشروعًا مدنيًا يستغرق فيه إنتاج المسودة ساعتين، بينما تحتاج المراجعة والاختبار والدمج ثماني ساعات. إذا اختفت الساعتان لم يختف المشروع؛ انخفضت كلفته من عشر ساعات إلى ثمان. المثال حسابي لا تجريبي، لكنه يوضح لماذا قد يكون الانطباع أسرع من النتيجة. أحيانًا تضغط الأداة الجزء الذي نراه في العرض، وتترك الجزء الذي يتحمل المسؤولية القانونية والتشغيلية على حاله.

ثلاثة وكلاء ليسوا ثلاثة شهود

توزيع العمل بين نموذج يكتب وآخر يبحث وثالث يراجع قد يحسن التنظيم، لكنه لا يضمن استقلال الحكم أو اختلاف مصادر الخطأ. إذا كانت النماذج تتلقى المعلومات نفسها، أو تعتمد على الافتراض نفسه، أو ترى إجابة بعضها قبل بدء التحقق، فقد تتفق بثقة على نتيجة خاطئة. فتح ثلاث نوافذ للمحادثة لا يؤسس، وحده، لجنة مراجعة مستقلة.

تدعم أبحاث الأنظمة متعددة الوكلاء هذا الحذر. حللت دراسة أكثر من ألف وستمئة سجل تنفيذ عبر عدة أطر، وصنفت أربعة عشر نمطًا للفشل ضمن تصميم النظام، والتنسيق بين الوكلاء، والتحقق من المهمة. لا تقيّم الدراسة الحالة اليمنية، لكنها تذكرنا بأن عدد الوكلاء ليس مقياسًا كافيًا للجودة. 25

المراجعة المستقلة تبدأ من معيار منفصل، ودليل يمكن أن يخالف المخرج، وصلاحية لإيقاف العمل حين لا تكفي المعلومات. لهذا يصبح السؤال العملي: هل أنتج الوكيل المراجع اكتشافًا لم يكن الكاتب قادرًا على إنتاجه، أم أعاد صياغة الثقة نفسها؟ الاتفاق جميل في العرض، لكن الاعتمادية تحتاج احتمالًا حقيقيًا للاعتراض.

يمكن بناء هذا الاستقلال بطريقة مباشرة: يبدأ المراجع من مواصفات المهمة، ويصل إلى الأدلة الخام، ولا يُطلب منه الدفاع عن إجابة سابقة، ويُقاس أداؤه بالعيوب التي كشفها وتلك التي فاتته. وقد يكون المراجع إنسانًا أو أداة أو مزيجًا منهما؛ المهم أن يمتلك مسارًا يستطيع أن ينتهي إلى «لا تكفي الأدلة». المراجعة التي لا تستطيع الرفض ليست مراجعة، بل مرحلة إضافية في الإنتاج.

المنصة ترى نافذتها فقط

تملك شركات النماذج نوعًا جديدًا من الرؤية الأمنية. قد ترى أجزاء من مسار حل المشكلة، لا الملف النهائي وحده: ما الذي طُلب، وكيف تغير الطلب، وما الأدوات التي استُدعيت. هذه الرؤية تجعل تقاريرها ذات قيمة حقيقية، ولا سيما حين ترتبط بإنفاذ سياسات الاستخدام. لكنها تبقى رؤية منصة، وليست تعدادًا للعالم.

أنثروبيك نفسها توضح أن الحالات المختارة في تقريرها لافتة أو جديدة، وليست عينة ممثلة من الاستخدام المعتاد. لذلك لا يجوز تحويل عدد الحالات المنشورة إلى معدل انتشار. قد يزيد النشاط، وقد تتحسن آليات الكشف، وقد تتغير سياسة الإفصاح. وكما يعرف عالم البيانات، ارتفاع الحالات المكتشفة لا يحدد وحده أي هذه التفسيرات وقع. 1

وفي 9 سبتمبر 2026 وصفت مجموعة استخبارات التهديدات في غوغل انتقال بعض الخصوم من الطلبات البسيطة إلى سير عمل توكيلي وأتمتة مترابطة. هذا شاهد مستقل على نمط أوسع، لكنه لا يتحقق من الحالة اليمنية ولا يقدم معاملًا عامًا لرفع القدرة. جمع التقريرين مفيد لفهم الاتجاه؛ ودمجهما كشاهدين على الواقعة نفسها خطأ منهجي. 3

ماذا تعني القراءة السعودية؟

لا ينبغي أن تنحصر القراءة المحلية في سؤال ما يستطيع الخصم فعله. السؤال المقابل هو كيف نستخدم الأدوات داخل مؤسساتنا بحيث تكون النتيجة قابلة للفحص، والخطأ قابلًا للاحتواء، والخدمة قادرة على الاستمرار. التقنية التي تخفض كلفة التجربة يمكن أن ترفع أيضًا عدد الأخطاء التي تصل إلى فرق التشغيل إذا لم تتغير المراجعة معها.

أطلقت الهيئة الوطنية للأمن السيبراني في 5 يوليو 2026 مشاورة عامة على إرشادات للأمن السيبراني للذكاء الاصطناعي، تشمل الحوكمة والدفاع والصمود والأطراف الخارجية، وتمتد إلى الذكاء الاصطناعي التوليدي والتوكيلي. الصفحة المعلنة تثبت وجود مشاورة عامة، لا صدور قواعد نهائية ملزمة. هذه الدقة في الحالة التنظيمية ضرورية بقدر الدقة في الحالة التقنية. 8

على مستوى المؤسسة، تبدأ الحوكمة من المهمة والصلاحية: ماذا يحتاج الوكيل أن يقرأ؟ ماذا يستطيع أن يعدل؟ وأي انتقال إلى بيئة إنتاج يتطلب مراجعة موثقة؟ ثم يأتي سجل النتيجة: نسخة الأداة، والمصادر المستخدمة، والتعديلات، والاختبار الذي أجري، والجهة التي قبلت المخرج. الغاية ليست تخزين كل محادثة، بل حفظ ما يلزم لإعادة بناء القرار ومحاسبة العملية.

أما المقياس الأجدى فليس عدد الطلبات ولا الساعات التي يعتقد المستخدم أنه وفرها. المقياس هو الكلفة الكاملة لكل نتيجة مقبولة وفق اختبار مستقل: وقت الإعداد، والتشغيل، والمراجعة، وإعادة العمل، مع جودة محددة سلفًا. إذا تحسنت القيمة تحت هذا القياس فقد أثبتنا شيئًا نافعًا. وإذا تحسن النشاط الظاهر وحده فقد نكون أسرع في إنتاج ما سنضطر إلى إصلاحه لاحقًا.

ويحتاج هذا القياس إلى أن يدخل في الاستجابة للحوادث. إذا ساعد نموذج في تلخيص تنبيهات مركز عمليات، لا يكفي عدّ التنبيهات التي مر بها. يجب قياس ما أسقطه التلخيص، وزمن تحقق المحلل، ونسبة الاستنتاجات التي صمدت بعد المراجعة. وإذا ساعد في قرار صيانة أو تشغيل، ينبغي أن يبقى مسار العودة واضحًا عند ظهور خطأ. الحوكمة الجيدة لا تعاقب التجريب؛ تجعل التجربة قابلة للتعلم بدل أن تترك وراءها نتيجة بلا نسب.

السؤال الذي يستحق أن يبقى

يمكن رواية الخبر بطريقتين كسولتين. الأولى تقول إن الحوثيين استخدموا كلود لصناعة سلاح متقدم؛ وهي تتقدم على الدليل في الهوية والنتيجة. والثانية تقول إن الاختبار فشل، إذن لم يحدث شيء مهم؛ وهي تتجاهل أن مسارًا هندسيًا وصل إلى اختبار مادي وأن بيئة محاكاة تعمل خارج الاتصال بالمنصة كانت موجودة بالفعل؛ وهذا لا يثبت فعاليتها ولا يحدد مقدار إسهام كلود فيها. الأدلة لا تطلب منا الاختيار بين التهويل والطمأنة.

الرواية الأدق هي أن أنثروبيك رصدت خلية في شمال اليمن تستخدم نموذجًا متقدمًا في أجزاء من عمل برمجي مرتبط بأسلحة، وأن اختبارًا بدا فاشلًا، وأن الشركة لا تملك دليلًا على نشر منظومة تشغيلية، وأن هوية المستخدمين التنظيمية لم تُحسم. هذه القصة مثيرة بما يكفي كما هي. 1 2

ربما نخطئ حين نسأل: هل يستطيع الذكاء الاصطناعي صنع صاروخ؟ السؤال واسع إلى درجة أنه يخفي العمل الحقيقي. الأجدى أن نسأل: أي جزء من دورة تحويل المعرفة إلى محاولة أصبح أقل كلفة؟ وأين بقيت الاختبارات والمواد والخبرة والقرار قيودًا لا يمكن تجاوزها بالكلام؟

المعادلات والأبحاث والمكتبات كانت موجودة أصلًا. المتغير الجديد قد يكون انخفاض كلفة تركيبها داخل سير عمل. لذلك ينبغي أن تتجه أعين الباحث إلى المسافة بين الشاشة والنتيجة المقبولة: ما الذي رُصد، وما الذي أُنتج، وما الذي تحققت منه جهة مستقلة، وما الذي ثبت أنه يعمل. عندها فقط نعرف إن كنا أمام نص مقنع، أم قدرة موثوقة.

هذا الفرق مهم أيضًا لصانع القرار. إذا اعتبر كل مخرج قدرة فسيبدد الانتباه على الإنذارات، وإذا لم يهتم إلا بالمنظومات الناجحة فسيرى التحول بعد اكتماله. المساحة الأصعب تقع بينهما: مراقبة انخفاض كلفة المحاولات من دون منح كل محاولة رتبة إنجاز. ليست مهمة شاعرية، لكنها أقرب إلى العمل الأمني الحقيقي: تعريف الدليل، ومقارنة البدائل، وتحديث الحكم حين يصل اختبار أفضل.

وهي مهمة لا تنجزها شركة النموذج وحدها. يحتاج المزود إلى كشف الإساءة وإنفاذ سياساته، وتحتاج المؤسسة إلى ضبط صلاحيات أدواتها، ويحتاج الباحث إلى مقاومة القفز بين درجات الدليل، ويحتاج الصحفي إلى إبقاء الإسناد في الجملة. أما الدولة فتحتاج أن ترى السلسلة كاملة: المعرفة التي تنتقل، والمخرجات التي تبقى، والاختبارات التي تفشل، والآثار التي تصل إلى الناس. لا يصنع أي طرف الصورة منفردًا، ولذلك لا ينبغي أن يملك أي طرف حق إعلان النجاح منفردًا أيضًا، في أحسن الأحوال.

المراجع

  1. Detecting and countering misuse of AI: September 2026Anthropic
  2. Users in Houthi-held Yemen tried to develop advanced weapons with AI, Anthropic saysAssociated Press, 2026-09-11
  3. GTIG AI Threat Tracker: From Prompting to Autonomy – The Evolution of Adversarial AIGoogle Threat Intelligence Group, 2026-09-09
  4. World Food Programme scales up response in Yemen as fighting displaces thousandsWorld Food Programme, 2026-09-17
  5. Flames, smoke seen near Riyadh airport; Houthis claim attacks on Saudi capitalReuters, 2026-09-19
  6. 17 Iranians Charged With Conducting Massive Cyber Theft Campaign On Behalf Of The Islamic Revolutionary Guard Corps And Other Iranian EntitiesU.S. Department of Justice, 2026-08-18
  7. NCA Launches Public Consultation on AI Cybersecurity GuidelinesNational Cybersecurity Authority, 2026-07-05
  8. Final report of the Panel of Experts on YemenUnited Nations Security Council
  9. United Nations Country Team in Yemen Annual Report 2021United Nations in Yemen
  10. Red Sea ballistic missile attacks trigger Asian interest in defencesReuters, 2024-02-21
  11. Final report of the Panel of Experts on YemenUnited Nations Security Council, 2024-10-11
  12. U.S. Forces, Allies Conduct Joint StrikesU.S. Central Command, 2024-01-11
  13. Final report of the Panel of Experts on YemenUnited Nations Security Council, 2025-10-17
  14. Shamoon 2: Return of the Disttrack WiperUnit 42, 2016-11-30
  15. APT33: Insights into Iranian Cyber EspionageMandiant, 2017-09-20
  16. OilAlpha Spyware Used to Target Humanitarian Aid GroupsRecorded Future
  17. Intelligence and targeting in conventional weapons capabilitiesAnthropic
  18. Why Do Multi-Agent LLM Systems Fail?arXiv, 2025-03-17