AI Detection

مراجعة Winston AI: ادعاء الدقة 99.98% مقابل الأدلة

تعلن Winston AI عن دقة 99.98%، وهي أعلى نسبة تدّعيها ذاتيا في صناعة الكاشفات، وقد قيس ذلك على مجموعة اختبار داخلية لم تنشرها الشركة قط. وضع معيار RAID المُحكَّم دقتها الإجمالية عند 71% عند معدل إيجابيات كاذبة ثابت قدره 5%، مع أنها جاءت ثانية بين الكواشف التجارية الأربعة التي اختبرت. هنا ما يقيسه كل رقم فعليا، ولمن تناسب هذه الأداة حقا.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

تعلن Winston AI عن دقة تبلغ 99.98%، وهي أعلى نسبة تدّعيها أي أداة رئيسية لكشف النصوص المولدة بالذكاء الاصطناعي. تظهر هذه النسبة على الصفحة الرئيسية للشركة إلى جانب عبارة "The Most Trusted AI Detector"، وهي ناتجة من اختبارات داخلية أجرتها الشركة نفسها، لا من مختبر خارجي. ولا تُنشر معها أي منهجية، أو حجم مجموعة الاختبار، أو نسبة العينات البشرية إلى عينات الذكاء الاصطناعي، أو عتبة التشغيل. هذه الفجوة بين الادعاء ووثائقه هي أول ما يحتاج القارئ المتأني إلى معرفته عن هذه الأداة.

أما الأمر الثاني فهو أن Winston قد خضعت فعلا لاختبارات من جهات خارجية، وهو ما لا تستطيع بعض أدوات الكشف قوله. فقد أجرى معيار RAID، وهو دراسة محكمة عُرضت في ACL 2024، اختبار Winston مقابل نحو 6.2 مليون نص مولد آليا، وقياس دقة إجمالية بلغت 71.0% مع تثبيت معدل الإيجابيات الكاذبة عند 5%. وهذا بعيد جدا عن 99.98%. كما وضع Winston في المرتبة الثانية من بين أدوات الكشف التجارية الأربع التي جرى اختبارها، متقدمة على GPTZero و ZeroGPT. وكلتا الحقيقتين مهمتان، ولا تلغي إحداهما الأخرى.

ما يلي هو ما تمثله Winston ومن صُممت له، وما تدعيه الشركة، وما الذي يمكن أن تعنيه مقارنة معيارية ذاتية تبلغ 99.98% إحصائيا وما الذي لا يمكن أن تعنيه، وما الذي تُظهره الأرقام المستقلة فعلا.

ما هي Winston AI ومن يستخدمها؟

Winston AI هي أداة كشف مدفوعة قائمة على الاشتراك، وموجهة مباشرة إلى المعلمين وناشري المحتوى. وتبدو قائمة ميزاتها أشبه بسير عمل المعلم: يصف موقع الشركة OCR الذي يستخرج النص من المستندات الممسوحة ضوئيا، والصور، والكتابة اليدوية، كما يدرج تكاملا مع Google Classroom ضمن المنصات المدعومة، وفاحصا للانتحال إلى جانب كشف الذكاء الاصطناعي، وتنظيما للمستندات لإدارة دفعات من التسليمات. وتذكر الشركة أنها تكشف مخرجات ChatGPT و Gemini و Claude و LLaMA "وغير ذلك الكثير".

الجزء الأكثر تميّزًا في الواجهة هو المخرجات بحسب كل جملة. فبدلًا من إرجاع نسبة مئوية واحدة فقط، ينتج Winston ما يسميه خريطة تنبؤ بالذكاء الاصطناعي: تقييمًا ملوّنًا، جملة بجملة، للأجزاء من المستند التي تبدو مولدة آليًا. وبالنسبة إلى المربي، تكون هذه الخريطة أكثر فائدة من درجة مجردة، لأنها تُظهر أين يتركز الشك الذي يثيره الأداة. كما يسهل أيضًا الإفراط في تفسيرها، وهي نقطة ستُناقش أدناه.

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
الشارة موضع الحديث: 99.98% accurate، على الصفحة الرئيسية، من دون دراسة مسماة تقف وراءها.

ماذا تدّعي الشركة؟

الادعاء الرئيسي في الصفحة الرئيسية لـ Winston AI هو "99.98% Accurate." وحتى وقت كتابة هذا النص، لا تنشر الصفحة التي تعرض هذا الرقم كيف بُنيت مجموعة الاختبار، ولا عدد العينات التي تضمنتْها، ولا مزيج النصوص البشرية ونصوص الذكاء الاصطناعي الذي استُخدم فيها، ولا عتبة القرار التي ضُبط عليها الكاشف عند قياس هذا الرقم. وهذا ليس أمرًا غير مألوف في هذه الصناعة، فالفجوة نفسها بين ادعاءات الدقة لدى البائعين والأدلة المستقلة تظهر في معظم الكواشف في السوق. إن نسخة Winston من هذا الادعاء ليست سوى أكبر رقم وُضع عليها.

ماذا يمكن أن يعني فعليًا معيار ذاتي بنسبة 99.98%؟

تعامل مع الحساب بجدية للحظة. إن معدل دقة يبلغ 99.98% يعني 2 أخطاء في كل 10,000 عينة. ولقياس هذا الرقم أصلًا، تحتاج الشركة إلى مجموعة اختبار موسومة تضم على الأقل عشرات الآلاف من المستندات، بحيث يكون الأصل الحقيقي لكل نص معروفًا بيقين. ثم لا يصف الرقم إلا الأداء على تلك المجموعة: تلك النماذج، تلك المطالبات، تلك الأنواع النصية، ذلك الطول النصي، وعند عتبة مختارة واحدة.

لا يتطلب أيٌّ من ذلك سوء نية. إن كاشفًا جرى تدريبه على مقالات أنشأتها نماذج المحادثة الشائعة، ثم اختُبر على مجموعة نصوص من مقالات أنشأتها نماذج المحادثة الشائعة، سيحصل فعلًا على درجة تقترب من الحد الأعلى. المشكلة هي قابلية النقل. فبمجرد أن يأتي النص الوارد من نموذج مختلف، أو من استراتيجية أخذ عينات مختلفة، أو من كاتب يتسم أسلوبه الطبيعي بانتظام غير معتاد، فإن المجموعة النصية التي قيس عليها المعيار لم تعد تصف النص الذي يجري الحكم عليه. إن المعيار الداخلي تجربة مضبوطة يجريها الطرف الذي لديه أقوى مصلحة في نتيجتها، وفق شروط يختارها هو. إنه دليل، لكنه أضعف أنواع الأدلة، وغياب المنهجية يعني أن لا أحد خارج الشركة يستطيع حتى التحقق منه.

ماذا يُظهر الاختبار المستقل؟

أكثر اختبار عام صارم يتضمن Winston هو RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors، وهي دراسة خضعت لمراجعة الأقران أعدها Dugan وزملاؤه وعُرضت في ACL 2024. قيّم RAID 12 كاشفًا، من بينها أربعة منتجات تجارية، مقابل نحو 6.2 مليون توليد عبر 11 نموذج لغة، و8 مجالات كتابة، و4 استراتيجيات فك ترميز، و11 هجومًا خصوميًا، مع معايرة كل كاشف على معدل إيجابيات كاذبة واحد قدره 5% بحيث تكون الدرجات قابلة للمقارنة.

الكاشفالدقة الإجمالية في RAID (معدل الإيجابيات الكاذبة مضبوط عند 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

قراءتان لذلك الجدول صادقتان في الوقت نفسه. إن 71.0% الخاصة بـ Winston ليست قريبة بأي حال من 99.98%، ومع ذلك فقد تفوق Winston على اثنين من منافسيه التجاريين الثلاثة في أصعب معيار عام متاح. كما أن المتوسطات تخفي تباينًا كاشفًا. ففي نتائج RAID بحسب كل نموذج، سجل Winston نسبة 99.6% على مخرجات ChatGPT و98.8% على مخرجات GPT-4، وهي نسبة قريبة من الرقم الذي يعلنه هو نفسه، لكنه هبط إلى 47.6% على نص GPT-2 و24.8% على النص الصادر من النموذج الأساسي MPT-30B. وعلى النص الآلي المعاد الصياغة، انخفضت دقته إلى 52.6%.

هذا التباين هو القصة الكاملة لادعاء 99.98% في صورة مصغرة. فعلى النص الذي يشبه ما يُفترض أن الكاشف قد ضُبط عليه، أي نماذج المحادثة الحديثة التي تكتب نثرًا بسيطًا، يؤدي Winston أداءً قريبًا من تسويقه. أما خارج ذلك التوزيع، فيهبط الأداء هبوطًا حادًا. ويمكن لمعيار داخلي مبني على نص من داخل التوزيع أن ينتج فعلًا رقمًا شبه كامل، بينما لا يخبرك تقريبًا بأي شيء عن الخليط الفوضوي من النماذج والتعديلات وإعادة الصياغة الذي يحتويه صندوق بريد حقيقي. وتُعرض الإشارات الإحصائية التي تعتمد عليها الكواشف بمزيد من التفصيل في شرحنا عن كيف تعمل كواشف AI.

أضف الطابع البشري إلى بحثك الخاص

حوّل نصك المدعوم بالذكاء الاصطناعي واجعله يبدو بشريًا، من دون المساس بالكلمات المهمة أو الاستشهادات.

ابدأ مجانًا

الإيجابيات الكاذبة: من يتضرر؟

يجعل تصميم RAID مقايضة واحدة واضحة على نحو نادر ما تفعله تسويقات الشركات: فقد قيس كل معدل دقة في الدراسة بعد تثبيت معدل الإيجابيات الكاذبة عند 5%. وعند هذه المعايرة، يُوسم 1 من كل 20 وثيقة بشرية حقيقية. ويمكن للكاشف أن يخفض هذا المعدل برفع العتبة، لكن ذلك لا يكون إلا على حساب التقاط نص AI أقل، فالرقمان يتحركان معًا، وأي شركة تذكر أحدهما دون الآخر تذكر نصف نتيجة فقط.

عبء تلك الأخطاء لا يتوزع بالتساوي. فالكتابة النمطية، التقليدية، ومنخفضة التباين، تبدو آلية لكل كاشف إحصائي، وهذا الوصف ينطبق على أقسام المنهج، ومراجعات الأدبيات، والنثر الحذر للكتاب الذين يعملون بلغة ثانية. إن نمط إشارة كواشف AI إلى متحدثي الإنجليزية غير الأصليين بمعدلات مرتفعة موثق عبر الصناعة، ولا شيء في طريقة Winston يعفيها من ذلك. وتستحق خريطة التنبؤ على مستوى الجملة الحذر نفسه, فالجملة المظللة بالأحمر هي ملاحظة إحصائية عن أنماط الكلمات، لا دليل على التأليف. ينبغي للطلاب الذين يواجهون إشارة خاطئة أن يبدأوا بالتوثيق، لا بالاعتراف، ودليلنا حول كيفية إثبات أنك لم تستخدم AI يوضح ما الذي يقنع فعلا.

التسعير وإمكانية الوصول

Winston منتج مدفوع مع نسخة تجريبية محدودة. يذكر Winston نسخة تجريبية مجانية لمدة 14 يومًا مع 2,000 رصيد، وخطة Essential بسعر 18 دولارًا شهريًا، أو 10 دولارات شهريًا عند الفوترة السنوية، مع 100,000 رصيد شهري، وخطة Advanced بسعر 29 دولارًا شهريًا، أو 16 دولارًا سنويًا، تضيف مقاعد للفريق وعمليات فحص أكبر، وطبقة Elite أعلى من ذلك. بالنسبة إلى معلم فردي يفحص ما يعادل أعمال صف كامل، يضع ذلك Winston في فئة الشراء الاندفاعي، أرخص من العقود المؤسسية، وأكثر قدرة من معظم الأدوات المجانية.

مكان Winston في مشهد الكواشف

استنادًا إلى الأدلة المستقلة، فإن Winston كاشف تجاري متوسط السعر يؤدي أفضل من الفئة المجانية في السوق وأسوأ من دعايةه الخاصة. وهو يناسب معلمًا يريد رؤية على مستوى الجملة، وتكامل Classroom، وفحص الانتحال في أداة واحدة منخفضة التكلفة، ويتعامل مع كل نتيجة بوصفها مدخلا إلى محادثة لا حكمًا نهائيًا. ولا يناسب أي شخص يحتاج إلى أن تعمل الدرجة بوصفها دليلًا، لأن درجة أي كاشف لا تفعل ذلك.

المقارنة الكاملة

Winston هو أحد الكواشف في مجال مزدحم، والفجوة بين 71% و99.98% تمثل مثالًا واحدًا على نمط على مستوى الصناعة. لمعرفة كيفية مقارنته مع Turnitin وGPTZero وOriginality وZeroGPT وغيرها وفق الشروط نفسها القائمة على الأدلة أولًا، راجع دليلنا الكامل حول مقارنة كواشف AI.

ماذا وجدت أبحاثنا الخاصة

في دراسة اتفاق الكواشف التي أجرتها TextPulse Research، قيّمت تسع أدوات تجارية لكشف الذكاء الاصطناعي النصوص الأكاديمية التسعين نفسها. كان أحدها نصًا هجينًا من 455 كلمة: مقدمة وخاتمة مكتوبتان بشريًا حول جزء أوسط من 168 كلمة أنشأه الذكاء الاصطناعي. أعطى Winston AI هذا النص 7% ذكاءً اصطناعيًا، بينما تراوحت أحكام الأدوات الأخرى على الكلمات نفسها من 0% إلى 95.7%. الورقة الكاملة والمدونة النصية ومصفوفة درجات كل أداة متاحة بحرية عبر TextPulse Research.

Winston AI مع النص الهجين من مدونة الدراسة.
Winston AI مع النص الهجين من مدونة الدراسة.
XLinkedInFacebook

الأسئلة الشائعة

إن نسبة 99.98% هي ادعاء Winston AI الخاص، وقد قيس على مجموعة اختبار داخلية لم تنشرها الشركة. في معيار RAID المُحكَّم الذي عُرض في ACL 2024، سجلت Winston دقة إجمالية قدرها 71.0% مع تثبيت معدل الإيجابيات الكاذبة عند 5%، رغم أنها بلغت 99.6% على مخرجات ChatGPT تحديدا. يصف هذا الادعاء مجموعة نصوص مختارة، لا الأداء في العالم الواقعي.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

ابقَ على اطلاع على إضفاء الطابع البشري على AI

احصل على نصائح حول الكتابة الأكاديمية، وكشف AI، وإضفاء الطابع البشري على النصوص مباشرة إلى بريدك الوارد.

لا رسائل مزعجة. يمكنك إلغاء الاشتراك في أي وقت.