AI Detection

بررسی Winston AI: ادعای دقت 99.98% در برابر شواهد

Winston AI دقت 99.98% را تبلیغ می‌کند، بالاترین رقمِ خودادعاشده در صنعت آشکارسازها، که بر یک مجموعه آزمون داخلی اندازه‌گیری شده و شرکت هرگز آن را منتشر نکرده است. بنچمارک RAID داوری‌شده، دقت کلی آن را 71% در نرخ مثبت کاذب ثابت 5% قرار داد، که همچنان در میان چهار آشکارساز تجاری آزموده‌شده، دوم بود. در اینجا توضیح داده می‌شود که هر عدد دقیقاً چه چیزی را می‌سنجد و این ابزار واقعاً برای چه کسانی مناسب است.

7 min
Winston AI Review: The 99.98% Accuracy Claim vs the Evidence

Winston AI ادعای 99.98% دقت را مطرح می‌کند، بالاترین عددی که خودِ آن برای هر آشکارساز جریان اصلی AI اعلام کرده است. این عدد در صفحه اصلی شرکت، کنار عبارت "The Most Trusted AI Detector" قرار دارد و از آزمون داخلی خودِ شرکت به دست آمده است، نه از یک آزمایشگاه بیرونی. هیچ روش‌شناسی، اندازه مجموعه آزمون، نسبت نمونه‌های انسانی به AI، یا آستانه عملیاتی در کنار آن منتشر نشده است. این فاصله میان ادعا و مستندات آن، نخستین نکته‌ای است که یک خواننده دقیق باید درباره این ابزار بداند.

نکته دوم این است که Winston در واقع توسط ناظران بیرونی آزموده شده است، و این بیش از چیزی است که برخی آشکارسازها می‌توانند بگویند. معیار RAID، یک مطالعه داوری‌شده که در ACL 2024 ارائه شد، Winston را در برابر حدود 6.2 million متن تولیدشده توسط ماشین قرار داد و 71.0% دقت کلی را با نرخ مثبت کاذب ثابت‌شده در 5% اندازه‌گیری کرد. این رقم فاصله زیادی با 99.98% دارد. همچنین Winston را در میان چهار آشکارساز تجاری آزموده‌شده، در رتبه دوم قرار داد، بالاتر از GPTZero و ZeroGPT. هر دو واقعیت مهم‌اند، و هیچ‌کدام دیگری را منتفی نمی‌کند.

آنچه در ادامه می‌آید این است که Winston چیست و برای چه کسانی ساخته شده است، فروشنده چه ادعاهایی مطرح می‌کند، یک معیارسنجیِ خوداظهاریِ 99.98% از نظر آماری چه معنایی می‌تواند داشته باشد و چه معنایی نمی‌تواند داشته باشد، و اعداد مستقل در عمل چه چیزی را نشان می‌دهند.

Winston AI چیست و چه کسانی از آن استفاده می‌کنند؟

Winston AI یک آشکارساز پولی و مبتنی بر اشتراک است که مستقیماً برای آموزگاران و ناشران محتوا طراحی شده است. فهرست قابلیت‌های آن شبیه جریان کاری یک معلم است: وب‌سایت شرکت از OCR یاد می‌کند که متن را از اسناد اسکن‌شده، عکس‌ها و دست‌خط استخراج می‌کند، یک یکپارچه‌سازی Google Classroom را در میان پلتفرم‌های پشتیبانی‌شده فهرست می‌کند، یک بررسی‌کننده سرقت ادبی را در کنار تشخیص AI ارائه می‌دهد، و سازمان‌دهی اسناد را برای مدیریت دسته‌ای از ارسال‌ها فراهم می‌کند. فروشنده بیان می‌کند که این ابزار خروجی ChatGPT، Gemini، Claude، LLaMA "and much more" را تشخیص می‌دهد.

متمایزترین بخش رابط، خروجی جمله به جمله است. به جای آنکه فقط یک درصد واحد برگرداند، Winston چیزی را که آن را نقشه پیش‌بینی AI می‌نامد تولید می‌کند: ارزیابی‌ای رنگ‌کدگذاری‌شده و جمله به جمله از این که کدام بخش‌های یک سند به صورت تولیدشده توسط ماشین خوانده می‌شوند. برای یک مدرس، این نقشه از یک امتیاز خام مفیدتر است، زیرا نشان می‌دهد تردید ابزار بر کجا متمرکز شده است. همچنین ممکن است به آسانی بیش از حد تفسیر شود، نکته‌ای که در ادامه به آن پرداخته می‌شود.

Winston AI homepage: the most trusted AI detector, with a 99.98% accurate badge and 10 million users
نشان مورد بحث: 99.98% accurate، در صفحه اصلی، بدون هیچ مطالعه نام‌برده‌ای در پشت آن.

شرکت چه ادعایی می‌کند؟

ادعای اصلی در صفحه اصلی Winston AI این است که "99.98% Accurate." تا زمان نگارش این متن، صفحه‌ای که این رقم را نمایش می‌دهد توضیح نمی‌دهد که مجموعه آزمون چگونه ساخته شده است، چند نمونه در آن بوده است، از چه ترکیبی از متن انسانی و AI استفاده شده است، یا آستانه تصمیم‌گیری آشکارساز هنگام اندازه‌گیری این رقم روی چه مقداری تنظیم شده بوده است. این امر در این صنعت غیرمعمول نیست، همان شکاف میان ادعاهای دقت فروشنده و شواهد مستقل تقریباً در همه آشکارسازهای موجود در بازار دیده می‌شود. نسخه Winston از این ادعا صرفاً بزرگ‌ترین عددی است که کسی برای آن مطرح کرده است.

یک خودسنجی 99.98% واقعاً چه معنایی می‌تواند داشته باشد؟

برای لحظه‌ای حساب و کتاب را جدی بگیرید. نرخ دقت 99.98% یعنی 2 خطا در هر 10,000 نمونه. برای آنکه اصلاً بتوان چنین رقمی را اندازه گرفت، یک شرکت به یک مجموعه آزمون برچسب‌خورده با دست‌کم ده‌ها هزار سند نیاز دارد که منشأ واقعی هر متن در آن با قطعیت معلوم باشد. سپس این عدد فقط عملکرد را بر روی همان پیکره توصیف می‌کند, آن مدل‌های AI، آن promptها، آن گونه‌های متنی، آن طول متن، در یک آستانه انتخاب‌شده.

هیچ‌یک از این‌ها مستلزم سوءنیت نیست. یک آشکارساز که بر روی مقاله‌هایی آموزش دیده باشد که توسط مدل‌های گفت‌وگوی رایج تولید شده‌اند، و سپس بر روی پیکره‌ای از مقاله‌هایی که باز هم توسط مدل‌های گفت‌وگوی رایج تولید شده‌اند آزمون شود، واقعاً امتیازی نزدیک به سقف خواهد گرفت. مسئله، قابلیت انتقال است. به محض آنکه متن ورودی از مدلی متفاوت، راهبرد نمونه‌گیری متفاوت، یا نویسنده‌ای با سبک طبیعیِ به‌طور غیرعادی یکنواخت بیاید، پیکره‌ای که معیار بر اساس آن سنجیده شده است دیگر متنِ در حال داوری را توصیف نمی‌کند. یک معیار داخلی، آزمایشی کنترل‌شده است که توسط طرفی اجرا می‌شود که بیشترین منفعت را از نتیجه آن می‌برد، و آن هم در شرایطی که خود برمی‌گزیند. این یک شاهد است، اما ضعیف‌ترین نوع شاهد، و نبودِ روش‌شناسی یعنی هیچ‌کس بیرون از شرکت حتی نمی‌تواند آن را بررسی کند.

آزمون مستقل چه چیزی را نشان می‌دهد؟

سخت‌گیرانه‌ترین آزمون عمومی که Winston را نیز دربر می‌گیرد، RAID: A Shared Benchmark for Robust Evaluation of Machine-Generated Text Detectors است، یک مطالعه داوری‌شده توسط همتاها از Dugan و همکاران که در ACL 2024 ارائه شد. RAID، 12 آشکارساز، از جمله چهار محصول تجاری، را در برابر حدود 6.2 میلیون تولید متن، در 11 مدل زبانی، 8 حوزه نوشتاری، 4 راهبرد رمزگشایی، و 11 حمله خصمانه ارزیابی کرد، و هر آشکارساز را با همان نرخ 5% مثبت کاذب کالیبره کرد تا امتیازها قابل مقایسه باشند.

DetectorOverall accuracy in RAID (FPR fixed at 5%)
Originality.ai85.0%
Winston AI71.0%
GPTZero66.5%
ZeroGPT65.5%

دو خوانش از آن جدول، هر دو به یک اندازه صادق‌اند. 71.0% برای Winston هیچ شباهتی به 99.98% ندارد، و با این حال Winston هنوز دو مورد از سه رقیب تجاری خود را در سخت‌ترین معیار عمومیِ در دسترس پشت سر گذاشت. میانگین‌ها همچنین یک پراکندگی معنادار را پنهان می‌کنند. در نتایج مدل به مدلِ RAID، Winston برای خروجی ChatGPT امتیاز 99.6% و برای خروجی GPT-4 امتیاز 98.8% گرفت، که به رقم تبلیغ‌شده خودش نزدیک است، اما برای متن GPT-2 به 47.6% و برای متنِ مدل پایه MPT-30B به 24.8% سقوط کرد. در متن ماشین‌نویسی‌شدهِ بازنویسی‌شده، دقت آن به 52.6% کاهش یافت.

این پراکندگی، خلاصه‌ای از کل ماجرای ادعای 99.98% است. روی متنی که شبیه همان چیزی است که احتمالاً آشکارساز برای آن تنظیم شده بود، یعنی مدل‌های گفت‌وگوی اخیر که نثر ساده می‌نویسند، Winston نزدیک به ادعای بازاریابی خود عمل می‌کند. بیرون از آن توزیع، عملکرد به‌شدت افت می‌کند. یک معیار داخلی که از متنِ درون‌توزیعی ساخته شده باشد، می‌تواند واقعاً عددی نزدیک به کامل تولید کند، در حالی که تقریباً هیچ چیز درباره ترکیب آشفته مدل‌ها، ویرایش‌ها و بازنویسی‌هایی که یک صندوق ورودی واقعی در خود دارد به شما نمی‌گوید. سیگنال‌های آماری‌ای که آشکارسازها بر آن تکیه می‌کنند، در توضیح ما درباره نحوه کار آشکارسازهای AI با جزئیات بیشتری بررسی شده‌اند.

مقاله خود را انسانی‌سازی کنید

متنِ کمک‌گرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژه‌های مهم یا ارجاع‌ها.

رایگان شروع کنید

مثبت‌های کاذب: چه کسانی آسیب می‌بینند؟

طراحی RAID یک مصالحه را آشکار می‌کند که بازاریابی فروشندگان به‌ندرت نشان می‌دهد: هر امتیاز دقت در این مطالعه پس از ثابت نگه داشتن نرخ مثبت کاذب در 5% اندازه‌گیری شد. در آن کالیبراسیون، 1 نفر از هر 20 سند واقعاً انسانی برچسب‌گذاری می‌شود. یک آشکارساز می‌تواند با بالا بردن آستانه خود این نرخ را کاهش دهد، اما فقط به بهای شناسایی کمترِ متن AI، این دو عدد با هم حرکت می‌کنند، و فروشنده‌ای که یکی را بدون دیگری نقل می‌کند، در واقع نیمی از یک نتیجه را نقل می‌کند.

بار این خطاها به طور یکنواخت توزیع نمی‌شود. نوشتاری که فرمول‌وار، متعارف و کم‌تغییرپذیر است، برای هر آشکارساز آماری شبیه متن ماشینی خوانده می‌شود، و این توصیف با بخش‌های روش، مرورهای ادبیات، و نثر دقیق نویسندگانی که به زبان دوم کار می‌کنند سازگار است. الگوی AI detectors flagging non-native English speakers at elevated rates در سراسر صنعت مستند شده است، و هیچ چیز در روش Winston آن را مستثنا نمی‌کند. نقشه پیش‌بینی جمله به جمله نیز همان احتیاط را می‌طلبد: جمله‌ای که با رنگ قرمز برجسته شده است، یک مشاهده آماری درباره الگوهای واژگانی است، نه مدرکی درباره نویسندگی. دانشجویانی که با یک پرچم‌گذاری نادرست روبه‌رو می‌شوند باید از مستندسازی آغاز کنند، نه از اعتراف، راهنمای ما درباره how to prove you did not use AI توضیح می‌دهد چه چیزی واقعاً قانع‌کننده است.

قیمت‌گذاری و دسترسی

Winston یک محصول پولی با یک دوره آزمایشی محدود است. Winston یک دوره آزمایشی رایگان 14 روزه با 2,000 اعتبار، یک طرح Essential با قیمت $18 در ماه, یا $10 در ماه در صورت صورتحساب سالانه, با 100,000 اعتبار ماهانه، یک طرح Advanced با قیمت $29 در ماه, یا $16 سالانه, که صندلی‌های تیمی و اسکن‌های بزرگ‌تر را اضافه می‌کند، و یک سطح Elite بالاتر از آن را فهرست می‌کند. برای یک مدرس منفرد که تکالیف یک کلاس را بررسی می‌کند، این موضوع Winston را در محدوده خرید آنی قرار می‌دهد، ارزان‌تر از قراردادهای نهادی، و توانمندتر از بیشتر ابزارهای رایگان.

Winston در چشم‌انداز آشکارسازها کجا قرار می‌گیرد

بر اساس شواهد مستقل، Winston یک آشکارساز تجاری با قیمت میان‌رده است که از سطح رایگان بازار بهتر عمل می‌کند و از تبلیغات خودش ضعیف‌تر است. این ابزار برای مدرسی مناسب است که به دیدپذیری جمله به جمله، یکپارچگی با Classroom، و بررسی سرقت ادبی در یک ابزار کم‌هزینه نیاز دارد، و هر نتیجه را نه حکم نهایی، بلکه محرکی برای گفت‌وگو می‌داند. این ابزار برای کسی مناسب نیست که به نمره به عنوان مدرک نیاز دارد، زیرا نمره هیچ آشکارساز چنین کارکردی ندارد.

مقایسه کامل

Winston یکی از آشکارسازها در بازاری شلوغ است، و فاصله 71% در برابر 99.98% آن، یک نمونه از الگویی در سراسر صنعت است. برای اینکه ببینید در مقایسه با Turnitin، GPTZero، Originality، ZeroGPT و دیگران، بر پایه همان معیارهای مبتنی بر شواهد چگونه عمل می‌کند، راهنمای کامل ما درباره مقایسه آشکارسازهای AI را ببینید.

یافته‌های پژوهش خود ما

در مطالعه توافق آشکارسازهای TextPulse Research، نه آشکارساز تجاری هوش مصنوعی همان 90 متن دانشگاهی را ارزیابی کردند. یکی از آنها متنی ترکیبی با 455 واژه بود: آغاز و پایانی انسانی پیرامون بخش میانی 168 واژه‌ای تولیدشده با هوش مصنوعی. Winston AI به این متن نمره 7% هوش مصنوعی داد، در حالی که داوری ابزارهای دیگر درباره همان واژه‌ها از 0% تا 95.7% متغیر بود. مقاله کامل، پیکره و ماتریس نمرات هر ابزار به صورت آزاد در TextPulse Research در دسترس است.

Winston AI روی متن ترکیبی از پیکره مطالعه.
Winston AI روی متن ترکیبی از پیکره مطالعه.
XLinkedInFacebook

سؤالات متداول

رقم 99.98% ادعای خود Winston AI است که بر یک مجموعه آزمون داخلی اندازه‌گیری شده و شرکت آن را منتشر نکرده است. در بنچمارک RAID داوری‌شده که در ACL 2024 ارائه شد، Winston امتیاز دقت کلی 71.0% را با نرخ مثبت کاذب ثابت 5% به دست آورد، هرچند مشخصاً روی خروجی ChatGPT به 99.6% رسید. این ادعا یک پیکره انتخاب‌شده را توصیف می‌کند، نه عملکرد دنیای واقعی را.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

از تازه‌های انسان‌سازی AI باخبر بمانید

نکات مربوط به نگارش دانشگاهی، تشخیص AI و انسان‌سازی را در صندوق ورودی‌تان دریافت کنید.

بدون اسپم. هر زمان خواستید لغو اشتراک کنید.