بررسی Winston AI: ادعای دقت 99.98% در برابر شواهد
Winston AI دقت 99.98% را تبلیغ میکند، بالاترین رقمِ خودادعاشده در صنعت آشکارسازها، که بر یک مجموعه آزمون داخلی اندازهگیری شده و شرکت هرگز آن را منتشر نکرده است. بنچمارک RAID داوریشده، دقت کلی آن را 71% در نرخ مثبت کاذب ثابت 5% قرار داد، که همچنان در میان چهار آشکارساز تجاری آزمودهشده، دوم بود. در اینجا توضیح داده میشود که هر عدد دقیقاً چه چیزی را میسنجد و این ابزار واقعاً برای چه کسانی مناسب است.
Winston AI ادعای 99.98% دقت را مطرح میکند، بالاترین عددی که خودِ آن برای هر آشکارساز جریان اصلی AI اعلام کرده است. این عدد در صفحه اصلی شرکت، کنار عبارت "The Most Trusted AI Detector" قرار دارد و از آزمون داخلی خودِ شرکت به دست آمده است، نه از یک آزمایشگاه بیرونی. هیچ روششناسی، اندازه مجموعه آزمون، نسبت نمونههای انسانی به AI، یا آستانه عملیاتی در کنار آن منتشر نشده است. این فاصله میان ادعا و مستندات آن، نخستین نکتهای است که یک خواننده دقیق باید درباره این ابزار بداند.
نکته دوم این است که Winston در واقع توسط ناظران بیرونی آزموده شده است، و این بیش از چیزی است که برخی آشکارسازها میتوانند بگویند. معیار RAID، یک مطالعه داوریشده که در ACL 2024 ارائه شد، Winston را در برابر حدود 6.2 million متن تولیدشده توسط ماشین قرار داد و 71.0% دقت کلی را با نرخ مثبت کاذب ثابتشده در 5% اندازهگیری کرد. این رقم فاصله زیادی با 99.98% دارد. همچنین Winston را در میان چهار آشکارساز تجاری آزمودهشده، در رتبه دوم قرار داد، بالاتر از GPTZero و ZeroGPT. هر دو واقعیت مهماند، و هیچکدام دیگری را منتفی نمیکند.
آنچه در ادامه میآید این است که Winston چیست و برای چه کسانی ساخته شده است، فروشنده چه ادعاهایی مطرح میکند، یک معیارسنجیِ خوداظهاریِ 99.98% از نظر آماری چه معنایی میتواند داشته باشد و چه معنایی نمیتواند داشته باشد، و اعداد مستقل در عمل چه چیزی را نشان میدهند.
Winston AI چیست و چه کسانی از آن استفاده میکنند؟
Winston AI یک آشکارساز پولی و مبتنی بر اشتراک است که مستقیماً برای آموزگاران و ناشران محتوا طراحی شده است. فهرست قابلیتهای آن شبیه جریان کاری یک معلم است: وبسایت شرکت از OCR یاد میکند که متن را از اسناد اسکنشده، عکسها و دستخط استخراج میکند، یک یکپارچهسازی Google Classroom را در میان پلتفرمهای پشتیبانیشده فهرست میکند، یک بررسیکننده سرقت ادبی را در کنار تشخیص AI ارائه میدهد، و سازماندهی اسناد را برای مدیریت دستهای از ارسالها فراهم میکند. فروشنده بیان میکند که این ابزار خروجی ChatGPT، Gemini، Claude، LLaMA "and much more" را تشخیص میدهد.
متمایزترین بخش رابط، خروجی جمله به جمله است. به جای آنکه فقط یک درصد واحد برگرداند، Winston چیزی را که آن را نقشه پیشبینی AI مینامد تولید میکند: ارزیابیای رنگکدگذاریشده و جمله به جمله از این که کدام بخشهای یک سند به صورت تولیدشده توسط ماشین خوانده میشوند. برای یک مدرس، این نقشه از یک امتیاز خام مفیدتر است، زیرا نشان میدهد تردید ابزار بر کجا متمرکز شده است. همچنین ممکن است به آسانی بیش از حد تفسیر شود، نکتهای که در ادامه به آن پرداخته میشود.

شرکت چه ادعایی میکند؟
ادعای اصلی در صفحه اصلی Winston AI این است که "99.98% Accurate." تا زمان نگارش این متن، صفحهای که این رقم را نمایش میدهد توضیح نمیدهد که مجموعه آزمون چگونه ساخته شده است، چند نمونه در آن بوده است، از چه ترکیبی از متن انسانی و AI استفاده شده است، یا آستانه تصمیمگیری آشکارساز هنگام اندازهگیری این رقم روی چه مقداری تنظیم شده بوده است. این امر در این صنعت غیرمعمول نیست، همان شکاف میان ادعاهای دقت فروشنده و شواهد مستقل تقریباً در همه آشکارسازهای موجود در بازار دیده میشود. نسخه Winston از این ادعا صرفاً بزرگترین عددی است که کسی برای آن مطرح کرده است.
یک خودسنجی 99.98% واقعاً چه معنایی میتواند داشته باشد؟
برای لحظهای حساب و کتاب را جدی بگیرید. نرخ دقت 99.98% یعنی 2 خطا در هر 10,000 نمونه. برای آنکه اصلاً بتوان چنین رقمی را اندازه گرفت، یک شرکت به یک مجموعه آزمون برچسبخورده با دستکم دهها هزار سند نیاز دارد که منشأ واقعی هر متن در آن با قطعیت معلوم باشد. سپس این عدد فقط عملکرد را بر روی همان پیکره توصیف میکند, آن مدلهای AI، آن promptها، آن گونههای متنی، آن طول متن، در یک آستانه انتخابشده.
هیچیک از اینها مستلزم سوءنیت نیست. یک آشکارساز که بر روی مقالههایی آموزش دیده باشد که توسط مدلهای گفتوگوی رایج تولید شدهاند، و سپس بر روی پیکرهای از مقالههایی که باز هم توسط مدلهای گفتوگوی رایج تولید شدهاند آزمون شود، واقعاً امتیازی نزدیک به سقف خواهد گرفت. مسئله، قابلیت انتقال است. به محض آنکه متن ورودی از مدلی متفاوت، راهبرد نمونهگیری متفاوت، یا نویسندهای با سبک طبیعیِ بهطور غیرعادی یکنواخت بیاید، پیکرهای که معیار بر اساس آن سنجیده شده است دیگر متنِ در حال داوری را توصیف نمیکند. یک معیار داخلی، آزمایشی کنترلشده است که توسط طرفی اجرا میشود که بیشترین منفعت را از نتیجه آن میبرد، و آن هم در شرایطی که خود برمیگزیند. این یک شاهد است، اما ضعیفترین نوع شاهد، و نبودِ روششناسی یعنی هیچکس بیرون از شرکت حتی نمیتواند آن را بررسی کند.
آزمون مستقل چه چیزی را نشان میدهد؟
سختگیرانهترین آزمون عمومی که Winston را نیز دربر میگیرد، RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors است، یک مطالعه داوریشده توسط همتاها از Dugan و همکاران که در ACL 2024 ارائه شد. RAID، 12 آشکارساز، از جمله چهار محصول تجاری، را در برابر حدود 6.2 میلیون تولید متن، در 11 مدل زبانی، 8 حوزه نوشتاری، 4 راهبرد رمزگشایی، و 11 حمله خصمانه ارزیابی کرد، و هر آشکارساز را با همان نرخ 5% مثبت کاذب کالیبره کرد تا امتیازها قابل مقایسه باشند.
| Detector | Overall accuracy in RAID (FPR fixed at 5%) |
|---|---|
| Originality.ai | 85.0% |
| Winston AI | 71.0% |
| GPTZero | 66.5% |
| ZeroGPT | 65.5% |
دو خوانش از آن جدول، هر دو به یک اندازه صادقاند. 71.0% برای Winston هیچ شباهتی به 99.98% ندارد، و با این حال Winston هنوز دو مورد از سه رقیب تجاری خود را در سختترین معیار عمومیِ در دسترس پشت سر گذاشت. میانگینها همچنین یک پراکندگی معنادار را پنهان میکنند. در نتایج مدل به مدلِ RAID، Winston برای خروجی ChatGPT امتیاز 99.6% و برای خروجی GPT-4 امتیاز 98.8% گرفت، که به رقم تبلیغشده خودش نزدیک است، اما برای متن GPT-2 به 47.6% و برای متنِ مدل پایه MPT-30B به 24.8% سقوط کرد. در متن ماشیننویسیشدهِ بازنویسیشده، دقت آن به 52.6% کاهش یافت.
این پراکندگی، خلاصهای از کل ماجرای ادعای 99.98% است. روی متنی که شبیه همان چیزی است که احتمالاً آشکارساز برای آن تنظیم شده بود، یعنی مدلهای گفتوگوی اخیر که نثر ساده مینویسند، Winston نزدیک به ادعای بازاریابی خود عمل میکند. بیرون از آن توزیع، عملکرد بهشدت افت میکند. یک معیار داخلی که از متنِ درونتوزیعی ساخته شده باشد، میتواند واقعاً عددی نزدیک به کامل تولید کند، در حالی که تقریباً هیچ چیز درباره ترکیب آشفته مدلها، ویرایشها و بازنویسیهایی که یک صندوق ورودی واقعی در خود دارد به شما نمیگوید. سیگنالهای آماریای که آشکارسازها بر آن تکیه میکنند، در توضیح ما درباره نحوه کار آشکارسازهای AI با جزئیات بیشتری بررسی شدهاند.
مقاله خود را انسانیسازی کنید
متنِ کمکگرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژههای مهم یا ارجاعها.
مثبتهای کاذب: چه کسانی آسیب میبینند؟
طراحی RAID یک مصالحه را آشکار میکند که بازاریابی فروشندگان بهندرت نشان میدهد: هر امتیاز دقت در این مطالعه پس از ثابت نگه داشتن نرخ مثبت کاذب در 5% اندازهگیری شد. در آن کالیبراسیون، 1 نفر از هر 20 سند واقعاً انسانی برچسبگذاری میشود. یک آشکارساز میتواند با بالا بردن آستانه خود این نرخ را کاهش دهد، اما فقط به بهای شناسایی کمترِ متن AI، این دو عدد با هم حرکت میکنند، و فروشندهای که یکی را بدون دیگری نقل میکند، در واقع نیمی از یک نتیجه را نقل میکند.
بار این خطاها به طور یکنواخت توزیع نمیشود. نوشتاری که فرمولوار، متعارف و کمتغییرپذیر است، برای هر آشکارساز آماری شبیه متن ماشینی خوانده میشود، و این توصیف با بخشهای روش، مرورهای ادبیات، و نثر دقیق نویسندگانی که به زبان دوم کار میکنند سازگار است. الگوی AI detectors flagging non-native English speakers at elevated rates در سراسر صنعت مستند شده است، و هیچ چیز در روش Winston آن را مستثنا نمیکند. نقشه پیشبینی جمله به جمله نیز همان احتیاط را میطلبد: جملهای که با رنگ قرمز برجسته شده است، یک مشاهده آماری درباره الگوهای واژگانی است، نه مدرکی درباره نویسندگی. دانشجویانی که با یک پرچمگذاری نادرست روبهرو میشوند باید از مستندسازی آغاز کنند، نه از اعتراف، راهنمای ما درباره how to prove you did not use AI توضیح میدهد چه چیزی واقعاً قانعکننده است.
قیمتگذاری و دسترسی
Winston یک محصول پولی با یک دوره آزمایشی محدود است. Winston یک دوره آزمایشی رایگان 14 روزه با 2,000 اعتبار، یک طرح Essential با قیمت $18 در ماه, یا $10 در ماه در صورت صورتحساب سالانه, با 100,000 اعتبار ماهانه، یک طرح Advanced با قیمت $29 در ماه, یا $16 سالانه, که صندلیهای تیمی و اسکنهای بزرگتر را اضافه میکند، و یک سطح Elite بالاتر از آن را فهرست میکند. برای یک مدرس منفرد که تکالیف یک کلاس را بررسی میکند، این موضوع Winston را در محدوده خرید آنی قرار میدهد، ارزانتر از قراردادهای نهادی، و توانمندتر از بیشتر ابزارهای رایگان.
Winston در چشمانداز آشکارسازها کجا قرار میگیرد
بر اساس شواهد مستقل، Winston یک آشکارساز تجاری با قیمت میانرده است که از سطح رایگان بازار بهتر عمل میکند و از تبلیغات خودش ضعیفتر است. این ابزار برای مدرسی مناسب است که به دیدپذیری جمله به جمله، یکپارچگی با Classroom، و بررسی سرقت ادبی در یک ابزار کمهزینه نیاز دارد، و هر نتیجه را نه حکم نهایی، بلکه محرکی برای گفتوگو میداند. این ابزار برای کسی مناسب نیست که به نمره به عنوان مدرک نیاز دارد، زیرا نمره هیچ آشکارساز چنین کارکردی ندارد.
مقایسه کامل
Winston یکی از آشکارسازها در بازاری شلوغ است، و فاصله 71% در برابر 99.98% آن، یک نمونه از الگویی در سراسر صنعت است. برای اینکه ببینید در مقایسه با Turnitin، GPTZero، Originality، ZeroGPT و دیگران، بر پایه همان معیارهای مبتنی بر شواهد چگونه عمل میکند، راهنمای کامل ما درباره مقایسه آشکارسازهای AI را ببینید.
یافتههای پژوهش خود ما
در مطالعه توافق آشکارسازهای TextPulse Research، نه آشکارساز تجاری هوش مصنوعی همان 90 متن دانشگاهی را ارزیابی کردند. یکی از آنها متنی ترکیبی با 455 واژه بود: آغاز و پایانی انسانی پیرامون بخش میانی 168 واژهای تولیدشده با هوش مصنوعی. Winston AI به این متن نمره 7% هوش مصنوعی داد، در حالی که داوری ابزارهای دیگر درباره همان واژهها از 0% تا 95.7% متغیر بود. مقاله کامل، پیکره و ماتریس نمرات هر ابزار به صورت آزاد در TextPulse Research در دسترس است.

سؤالات متداول
رقم 99.98% ادعای خود Winston AI است که بر یک مجموعه آزمون داخلی اندازهگیری شده و شرکت آن را منتشر نکرده است. در بنچمارک RAID داوریشده که در ACL 2024 ارائه شد، Winston امتیاز دقت کلی 71.0% را با نرخ مثبت کاذب ثابت 5% به دست آورد، هرچند مشخصاً روی خروجی ChatGPT به 99.6% رسید. این ادعا یک پیکره انتخابشده را توصیف میکند، نه عملکرد دنیای واقعی را.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.