هل كواشف AI دقيقة؟ الإيجابيات الكاذبة والتحيز
تنشر الشركات معدلات إيجابيات كاذبة تقل عن 1%. ووجد باحثون مستقلون اختبروا الكواشف نفسها على الكتابة الإنجليزية لغير الناطقين بها معدلات تزيد على 60%. يوضح ما يلي ما تكشفه الأدلة.
تدّعي Turnitin أن معدل الإيجابيات الكاذبة لديها أقل من 1%. اختبرت مجموعة من الباحثين المستقلين عدة كواشف على نطاق أوسع من عينات الكتابة لغير الناطقين بالإنجليزية. ووجدوا أن متوسط معدل الإيجابيات الكاذبة كان أكثر من 60% في ذلك النوع نفسه من الكتابة. كلا الرقمين حقيقيان، وكلاهما نُشر، وكلاهما يتعلق بكواشف تُباع إلى السوق نفسها. هل كواشف الذكاء الاصطناعي دقيقة؟ يعتمد ذلك على الفئة السكانية التي اختبرتها، وعلى الكاشف الذي استخدمته، وعلى كيفية تعريف مزودك له منذ البداية.
لن يعيد هذا المنشور شرح كيفية حساب الكاشف لذلك الدرجة. الآلية، الحيرة، احتمال الرمز، وكيفية تدريب المصنف، مغطاة بالتفصيل في مكان آخر، ومن المفيد قراءتها أولًا إذا لم تكن قد فعلت. ما يهم هنا هو ما يحدث بعد وجود الدرجة: كم مرة تكون خاطئة، ومن تكون كتابته أكثر عرضة للخطأ، وما التكلفة الفعلية لاتهام كاذب لشخص لم يفعل شيئًا خاطئًا.
هل كواشف الذكاء الاصطناعي دقيقة؟
ليست دقيقة على نحو ثابت، والفجوة بين الادعاءات التسويقية والاختبار المستقل موثقة جيدًا. نشرت مجموعة من الباحثين بقيادة Debora Weber-Wulff نتائجها بشأن 14 أداة كشف، منها 12 مجانية واثنتان تجاريتان، جرى اختبارها مقابل مزيج من نصوص بشرية ونصوص ChatGPT في 2023. ووجدوا أن أيا من هذه الأدوات ليس دقيقًا أو موثوقًا، مع تحيز مدمج لوسم النص الآلي بوصفه بشريًا بدلًا من العكس. كانت اثنتان من الأدوات التجارية المشمولة في هذا الاختبار هما Turnitin و PlagiarismCheck. وأدت جميع الأدوات في هذا الاختبار أداء أسوأ عندما أعيدت صياغة النص.
لكن بعد عامين، الأمور ليست راكدة. فقد وضع بحثٌ أولي من كلية Booth في جامعة Chicago، أعده Brian Jabarian وAlex Imas، ثلاثة وافدين جدد، Pangram وGPTZero وOriginality.ai، ومنافسًا واحدًا مفتوح المصدر، تحت الاختبار باستخدام ما يقرب من 2,000 قطعة مكتوبة بشريًا من المدونات والأخبار والمراجعات والأعمال الأدبية. وفي ظل ظروف اختبار مضبوطة، لم تنخفض أفضل أداة ضمن المجموعة أبدًا عن 99.8 percent دقة، وحافظت على معدل الإيجابيات الكاذبة عند مستوى منخفض. وقد أدى النموذج مفتوح المصدر أداءً مماثلًا لأداء من يخمّن عشوائيًا. لقد تحسنت الأمور بالفعل. إلى حد ما. قليلًا.
لكن المشكلة تكمن في كلمة مضبوطة. فالمقاطع المعيارية نظيفة، وكاملة، وأُنتجت في ظل ظروف معروفة. أما المقالة المقدمة فليست أيًا من ذلك على نحو موثوق. وقد لا تكون نتائج العالم الحقيقي مطابقة لنتائج المختبر، كما قال Turnitin نفسه، كبير مسؤولي المنتجات، علنًا، رغم أن ذلك اعتراف نادر ومفيد من أحد الموردين. ويضع القسم التالي أرقام الموردين إلى جانب الأرقام المستقلة حتى تظهر الفجوة بوصفها أمرًا مرئيًا لا مجرد ادعاء.
ادعاءات الموردين مقابل الاختبار المستقل
يرتب الجدول أدناه ما تدعيه أربعة كواشف عن نفسها مقابل ما قاسه الباحثون المستقلون عندما اختبروا الأدوات مباشرة. اقرأ العمودين الأوسطين معًا، لا عمود المورد وحده.
| الكاشف | الدقة التي يدّعيها المورّد | الملاحظة بشكل مستقل | ما يقوله المورّد عن الإيجابيات الكاذبة |
|---|---|---|---|
| Turnitin | عتبة ثقة 98% قبل وضع علامة، وأقل من 1% من الإيجابيات الكاذبة على مستوى المستند | حوالي 80% دقة، وهو الأفضل بين 12 أداة في مقارنة 2023، على نسخة أقدم من الأداة | أقل من 1% على مستوى المستند فوق عتبة 20% من النص المكتوب بواسطة AI، وحوالي 4% على مستوى الجملة |
| GPTZero | 95.7% من اكتشاف نص AI عند معدل 1% من الإيجابيات الكاذبة على معيار RAID المستقل | 96% دقة في المقاطع القصيرة، ومعدل الإيجابيات الكاذبة أقل من 1% في دراسة 2025 لجامعة Chicago Booth | يذكر معدل إيجابيات كاذبة قدره 1% على معيار RAID |
| Originality.ai | 99% دقة، ومعدل إيجابيات كاذبة 0.5% (نموذج Lite)، و1.5% (نموذج Turbo) | معدل الإيجابيات الكاذبة أقل من 1%، لكنه فاته 10% إلى 40% من النص المكتوب بواسطة AI في دراسة Booth نفسها | ينشر أرقام الإيجابيات الكاذبة بشكل منفصل بحسب فئة النموذج |
| Pangram | معدلات خطأ يقول إنها أقل بأكثر من 38 مرة من الأدوات المنافسة، ويذكر أنه لا يوجد تحيز ضد الكتّاب غير الناطقين بالإنجليزية | الدقة لم تنخفض أبدا عن 99.8%، ومعدل الإيجابيات الكاذبة قريب من الصفر، في دراسة Booth | يذكر معدلات إيجابيات كاذبة قريبة من الصفر عبر 10 مجالات نصية و8 نماذج لغوية |
يبرز أمران. أولا، جميع أرقام المورّد صادرة عن مختبر يسيطر عليه المورّد، وأرقام Booth صادرة عن باحثين لا يبيعون شيئا. ثانيا، لا يظهر Turnitin إطلاقا في ذلك العمود الأوسط لأن دراسة 2025 لم تختبره. في الجدول، يستند رقمه المستقل إلى مقارنة سابقة في 2023، لكنه أُجري على نسخة أقدم من الأداة، لذا تذكر ذلك عند النظر إلى الجدول بوصفه مقارنة بين عناصر متماثلة.
ما مدى دقة اكتشاف AI لدى Turnitin؟
لا ينشر Turnitin رقمًا واحدًا للدقة. بل ينشر عتبة ومقايضة. وقد قالت الشركة إنها لا تضع علامة على أي مستند إلا عندما تكون واثقة بنسبة 98 percent من أن الجزء المعلَّم مكتوب بواسطة AI، وأن هذه العتبة هي ما يبقي معدل الإيجابيات الكاذبة على مستوى المستند دون 1 percent. وقد قدّر Turnitin أنه يلتقط نحو 85 percent من الكتابة المساعدة بواسطة AI، ويمرر الباقي عمدًا بدلًا من المخاطرة باتهام خاطئ.
أما النسبة الفعلية للإيجابيات الكاذبة التي يعيدها Turnitin على مستوى الجملة, حيث تبرز الواجهة أسطرًا محددة بدلًا من مستند كامل, فهي في الواقع أقرب إلى 4 percent. وهذا هو الرقم الذي يستحق المعرفة إذا التقط أستاذ لقطة شاشة لفقرة واحدة معلَّمة بدلًا من درجة المستند كله، لأن الجملة المظللة تحمل احتمالًا أعلى بشكل ملحوظ لأن تكون خاطئة من درجة المستند المجاورة لها.
ومن الجدير بالذكر أيضًا أن Turnitin اعترف بهذه الفجوة مباشرة. فقد وجدوا أن نتائجهم الأولى في العالم الواقعي, ولا سيما للمستندات الأقصر, كانت فيها معدلات أعلى من الإيجابيات الكاذبة مما كان متوقعًا استنادًا إلى اختباراتهم المعملية. لذلك عدلوا الحد الأدنى لطول المستند لكي يُقيَّم من 150 إلى 300 words. هذا يعني أن المورد عدل منتجه نفسه لأن الرقم المنشور لم يصمد خارج المختبر، وهو ما يقول بقدر ما تقوله أي دراسة مستقلة.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
ما الذي تكلفه الإيجابية الكاذبة الطالب فعليًا
حدث هذا لطالب في Executive MBA في Yale's School of Management. وُجِّهت إلى الطالب مخالفة، بالمعنى الحرفي الممكن. وكان الكاشف المعني هو GPTZero. وقد وُسم الامتحان النهائي للطالب في مقرر للتمويل من قبل مساعد تدريس، الذي رأى أن الكتابة طويلة ومفصلة مع علامات ترقيم وقواعد شبه مثالية. وكان هذا الأستاذ بعينه يشغله عبر GPTZero، الذي صنف الإجابات على أنها على الأرجح مولدة بواسطة AI.
فشل في المقرر وتم إيقافه لمدة سنة. وتدعي دعواه القضائية، المرفوعة أمام المحكمة الفيدرالية في فبراير 2025، أن سياسة Yale نفسها تقيد استخدام أدوات مثل GPTZero لهذا السبب بالذات، وهو معدل الإيجابيات الكاذبة الموثق لديها ضد المتحدثين غير الأصليين للإنجليزية، وأنه استخدمه بما يخالف تلك السياسة. كما تشير مذكرته إلى أن GPTZero أعطى درجة 100 percent مولدة بواسطة AI لكتابة أكاديمية كتبها الرئيس السابق للجامعة في Yale وعميد كلية الأعمال فيها.
رفض القاضي إصدار أمر قضائي مبكر في May 2025. ولم تُحسم القضية بعد, كما أكتب. ويزعم المدعي، وهو مواطن فرنسي، أن التحيز المعروف نفسه ضد المتحدثين غير الأصليين للإنجليزية هو الذي جعل كتابته تظهر على النحو الذي ظهرت به. وهذا ما ننظر فيه في القسم التالي. وما ليس محل جدل هو الثمن: سنة ضاعت من برنامج دراسي، ودرجة رسوب، ونفقات قانونية، وأشهر عدة من النزاع حول درجة بدلًا من نيل شهادة. إن معدل الإيجابيات الكاذبة البالغ 1 percent يبدو ضئيلًا إلى أن تجعل منه مجموعة كبيرة أمرًا يخص شخصًا بعينه.
لماذا تُصنِّف كواشف AI المتحدثين غير الأصليين للإنجليزية تصنيفًا خاطئًا؟
بصورة سيئة، وبفارق كبير. وهذه هي خلاصة الدراسة التي كانت أول من وضع رقمًا لذلك. أجرى باحثون في Stanford سبعة من كواشف GPT واسعة الاستخدام على 91 مقالة TOEFL كتبها متحدثون غير أصليين للإنجليزية وعلى 88 مقالة لطلاب الصف الثامن في الولايات المتحدة. قرأت الكواشف مقالات الصف الثامن قراءة صحيحة في معظم الأحيان تقريبًا. أما مقالات TOEFL، التي كتبها بالغون كانوا متمكنين بما يكفي لتقديم اختبار إنجليزية على مستوى الدراسات العليا، فقد بلغ متوسط معدل الإيجابيات الكاذبة لدى الكواشف 61.3 percent. وقد وُسِمت 89 من أصل 91 مقالة على أنها مولدة بواسطة GPT من قبل واحد على الأقل من الكواشف السبعة, ووُسِمت 18 من تلك المقالات من قبل الكواشف السبعة جميعًا.
الآلية هي نفسها التي تحكم بقية عملية الكشف: فالمفردات المتوقعة وبنية الجمل الأبسط تُقرأ على أنها انخفاض في الـ perplexity، وانخفاض الـ perplexity يُقرأ على أنه من صنع الآلة، بغض النظر عمّن يمسك القلم. يعتمد الكتّاب الذين يعملون بلغة ثانية على الصياغات الراسخة لأن هذا هو ما يبدو عليه بالفعل الطلاقة في لغة إضافية، وهذا هو بالضبط النمط الذي صُمم الكاشف لرصده.
الكتّاب في هذا الوضع لا تفيدهم النصيحة التي تدعوهم ببساطة إلى الكتابة بصورة أكثر طبيعية، لأن الطبيعي هو بالضبط ما جرى وسمه. تغطي صفحة TextPulse للكتّاب الأكاديميين في ESL أنماط الصياغة الكامنة وراء هذا الخطر بمزيد من التفصيل، بما في ذلك ما الذي يغيّرها من دون تغيير معنى الجملة.
لم تكن هذه حالة معزولة. ففي ديسمبر 2025، صدر معيار جديد صُمم صراحة لتقييم التحيز في هذه الكواشف. وقد تضمن أكثر من 200,000 عينة عبر ديموغرافيات ولغات متعددة. وعلى الرغم من أنه جاء بعد عامين من الدراسة الأولى لـ Stanford، وتضمن العديد من الإصدارات النموذجية المختلفة للكواشف نفسها، كشف هذا المعيار أن التحيز تجاه متعلمي اللغة الإنجليزية لا يزال قائماً.
هذا ليس حال جميع الموردين. تنص الوثائق التقنية الخاصة بـ Pangram على أن مصنفها ليس متحيزاً ضد المتحدثين بالإنجليزية من غير الناطقين بها. ولم يختبر باحثو Chicago Booth هذا الادعاء بشكل مستقل، لكنه يبين أن الجيل الأحدث من الكواشف يُبنى مع أخذ المشكلة في الحسبان بدلاً من تجاهلها.
إذا أردت أن ترى موقع كتابتك أنت قبل أن يقيّمها أي شخص آخر، فإن أداة مجانية للتحقق من الـ perplexity تمنحك الرقم الأساسي نفسه الذي سيحسبه الكاشف، من دون إرسال أي شيء إلى مؤسسة أولاً.
من غيره يجري وسمه، ولماذا
يتحمل غير الناطقين بالإنجليزية أكبر خطر موثق، لكن المنطق الإحصائي نفسه يلتقط كتابات أخرى أيضاً. وجد فريق Weber-Wulff أن جميع الأدوات الـ 14 التي اختبروها كانت أقل دقة عندما شغلوها على نصوص معاد صياغتها، وهذا يصف جزءاً ذا شأن من الكتابة الأكاديمية التي مرّت على مدقق لغوي أو محرر أو قلم أحمر لمشرف قبل أن يشغل أي شخص كاشفاً عليها.
لا يعني أي من هذا أن الرقم بلا معنى، بل يعني فقط أنه يحتاج إلى تأكيد قبل أن يدل على أي شيء يتعلق بشخص بعينه. إذا كان لديك نص يبدو متجانساً، بأطوال جمل متشابهة وإيقاع متشابه في جميع أجزائه، فسيسجل على أنه أكثر شبهاً بالنص الآلي، بغض النظر عمن كتبه أو لماذا. ويمكن التحقق من ذلك مباشرة باستخدام free burstiness checker بدلاً من التخمين.
ما الذي تبدو عليه سياسة قابلة للدفاع عنها لكشف AI
كانت لدى Yale بالفعل سياسة تقيّد، على ما يبدو، أدوات مثل GPTZero، لأسباب قريبة من تلك التي عرضتها هذه المقالة، وهي معدل إيجابيات كاذبة موثق، وانحياز موثق ضد الكتّاب غير الناطقين بالإنجليزية. لذا فهذه ليست بقدر ما هي قصة طالب واحد سيئ الحظ، بل قصة قاعدة قائمة لم يتم الالتزام بها. وعندما تفرض السياسة فعلاً الفرق بين الدرجة والحكم، تصبح الدرجة أحد المدخلات لا حكماً نهائياً.
- تعامل مع الدرجة بوصفها أحد المدخلات، لا الأساس الوحيد لإثبات المخالفة
- أفصح للطلاب عن معدل الإيجابيات الكاذبة المنشور للأداة قبل استخدامها ضدهم
- طبّق حذراً إضافياً على التسليمات القصيرة والكتابة لغير الناطقين بالإنجليزية، وهما نقطتا ضعف موثقتان
- ضمن مساراً للاستئناف لا يتطلب دحض إحصائية
لا شيء في هذا غريب. إنه أقرب إلى الطريقة التي ينبغي أن يعامل بها أي دليل جنائي منفرد في أي سياق آخر، مفيد، قابل للتحقق، وغير كافٍ أبداً بذاته.
بالنسبة إلى الكاتب الفرد، ينطبق المبدأ نفسه قبل وجود الدرجة لا بعده. فالرقم الواحد، من أي أداة، هو تقدير لا حكماً نهائياً، والتعامل معه على أنه يقين في أي من الاتجاهين، آمن أو مكشوف، يطلب من الرقم أكثر مما يستطيع أن يسنده.
تُبلغ أداة AI humanizer tool الخاصة بـ TextPulse عن Human Score وفق المنطق نفسه: وهو تقدير يُحسب من نصك أنت، لا حكم كاشف عليه، وهو مفيد بوصفه إشارة إلى كيفية قراءة المسودة في الوقت الحالي، لا بوصفه وعدا بما سيقوله أي كاشف بعينه.
تنقسم مسألة الدقة إلى أسئلة أضيق، ولكل منها صفحة خاصة بها. معدل وسم الكاشفات للكتابة البشرية مغطى على حدة، وكذلك الأدلة المحددة على معدل الإيجابيات الكاذبة في Turnitin وعلى دقة ZeroGPT. إذا كان قد استُخدم ضدك بالفعل، فهناك مواد عملية عن ما الذي يجب فعله عندما تُتهم باستخدام AI، وعن الأدلة التي يمكنك جمعها لإثبات أنك لم تستخدم AI، وعن كتابة خطاب استئناف يجيب عن الدرجة وفق شروطها هي.
سيظل الرقم في أي تقرير يتغير مع إعادة البائعين تدريب نماذجهم ومع استمرار الباحثين في اختبارها ضد الحالات الأصعب. لكن ما لا ينبغي أن يتغير هو العادة الكامنة وراءه: اقرأ الدرجة بوصفها قياسا واحدا من بين عدة قياسات، واسأل عن الفئة السكانية التي جرى التحقق من صحتها عليها، واسأل عما لا يقوله البائع عن الحالات التي لا يزال يخطئ فيها.
Frequently Asked Questions
نعم. وجد Weber-Wulff وزملاؤه أن أدوات كشف AI «ليست دقيقة ولا موثوقة» في مقارنة أجريت في 2023، ويواجه الكتّاب غير الناطقين بالإنجليزية أعلى خطر موثق، إذ وجدت إحدى الدراسات متوسط معدل إيجابيات كاذبة يزيد على 60% في مقالات TOEFL. إن درجة واحدة ليست دليلاً على أي شيء بحد ذاتها، ولهذا لا ينبغي أبداً أن تكون الدليل الوحيد وراء الاتهام.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.