AI Detection

آیا ZeroGPT دقیق است؟

پرسش‌های متداول خود ZeroGPT ادعا می‌کند که نرخ آن در آزمون داخلی به 98 درصد نزدیک می‌شود و جداگانه می‌پذیرد که نوشتار قالبی می‌تواند صرف‌نظر از نویسنده، به صورت AI خوانده شود. در اینجا آمده است که شرکت درباره روش خود چه می‌گوید، آزمون مستقل روی همین محصول چه یافته است، و یک امتیاز رایگان در عمل چه کاربردی دارد.

4 min
ZeroGPT accuracy: the company's own claimed rate next to its disclosed limitations on formulaic writing

دقت ZeroGPT، بر اساس ادعای کنونی خود شرکت، نرخی است که «به سمت >98% در ارزیابی‌های داخلی پیش می‌رود»، رقمی که شرکت می‌پذیرد از آزمونی به دست آمده که خودِ شرکت روی خودش انجام داده است، نه از یک آزمایشگاه بیرونی. همین یک قید، یعنی داخلی، بیش از همه چیزی است که یک خواننده پیش از آنکه هر درصدی از یک آشکارساز رایگان را واقعیت قطعی بداند، به آن نیاز دارد.

ZeroGPT یکی از پرکاربردترین آشکارسازهای رایگان AI است، تا حد زیادی چون هزینه‌ای ندارد و در چند ثانیه پاسخ می‌دهد. همان شکاف میان ادعاهای فروشنده و آزمون مستقل که به طور کلی در سراسر آشکارسازهای AI دیده می‌شود اینجا هم دیده می‌شود. آنچه در ادامه می‌آید، آن چیزی است که شرکت اکنون درباره دقت و روش خود بیان می‌کند، این روش ظاهراً در عمل چه چیزی را می‌سنجد، و چرا ابزاری از این نوع در گونه‌های خاص و قابل پیش‌بینیِ نوشتاری که خوانندگان دانشگاهی ارائه می‌کنند، معمولاً دچار خطا می‌شود.

ZeroGPT homepage detector with a 15,000 character free input and no signup required
پیش‌بررسی رایگان در مرکز این بررسی, 15,000 نویسه, بدون نیاز به حساب کاربری.

دقت ZeroGPT چیست، بر اساس گفته شرکت؟

سؤالات متداول خود ZeroGPT بیان می‌کند که شرکت «دقتی پیشرو در صنعت ارائه می‌دهد و به طور پیوسته بهبود می‌یابد تا عملکردی در سطح بهترین‌ها را حفظ کند، و به سمت >98% در ارزیابی‌های داخلی پیش می‌رود». این ادعای یک فروشنده درباره محصول خودش است، که خودِ شرکت آن را آزموده است، و در خودِ عبارت نیز نوعی احتیاط واقعی نهفته است: «به سمت» یک عدد پیش رفتن، همان ادعا را ندارد که به آن رسیده و آن را حفظ کرده باشد، و «ارزیابی‌های داخلی» یعنی هیچ طرف بیرونی رقمی هم‌ارز با آن منتشر نکرده است. در صفحه هیچ چیز نمی‌گوید که آن مجموعه آزمون داخلی چه اندازه‌ای داشته، چه چیزی را دربر می‌گرفته، یا چه کسی بیرون از شرکت روش‌شناسی را بررسی کرده است.

این شرکت برای یک نتیجه پایدار دست‌کم 150 تا 200 کلمه متن را توصیه می‌کند، و می‌گوید 500 تا 1,000 کلمه یا بیشتر، قابلیت اتکای آن را باز هم افزایش می‌دهد، و صریحاً بیان می‌کند که قطعه‌های بسیار کوتاه یا به‌شدت ویرایش‌شده «نشانه‌های کمتری را حمل می‌کنند». همین افشای واحد از درصدِ تیتر مهم‌تر است. این، اذعان خودِ فروشنده است که امتیاز فقط به اندازه‌ای قابل اعتماد است که ورودی طولانی و دست‌نخورده باشد، شرطی که یک ارسال واقعی همیشه آن را برآورده نمی‌کند.

ZeroGPT در واقع از چه روشی استفاده می‌کند؟

ZeroGPT سامانه زیربنایی خود را DeepAnalyse می‌نامد، که در وب‌سایت خودش به‌عنوان یک «روش‌شناسی چندمرحله‌ای که برای بهینه‌سازی دقت در حالی که مثبت‌های کاذب و منفی‌های کاذب را به حداقل می‌رساند طراحی شده است» توصیف می‌شود و متنی را «از سطح کلان تا سطح خرد» می‌خواند. پرسش‌های متداول آن، زیر این نام تجاری، چیزی مشخص‌تر را توصیف می‌کند: تحلیلی از «الگوهای توکن، burstiness، entropy، و ویژگی‌های طبقه‌بند ensemble که بر روی مجموعه‌داده‌های ترکیبی آموزش دیده‌اند».

Burstiness و entropy به ZeroGPT منحصر نیستند. آن‌ها همان ویژگی‌های آماری هستند، یعنی این‌که طول و ریتم جمله‌ها تا چه اندازه تغییر می‌کند، و این‌که هر واژه بعدی تا چه حد قابل پیش‌بینی است، که توضیح‌دهنده خودِ TextPulse در how AI detectors work به‌عنوان سازوکار کلی پشت این کل دسته ابزارها پوشش می‌دهد. یک free perplexity checker همان عدد زیربنایی را مستقیماً نشان می‌دهد، بدون آن‌که از نویسنده بخواهد ابتدا به درصدِ هر فروشنده به‌تنهایی اعتماد کند.

مقاله خود را انسانی‌سازی کنید

متنِ کمک‌گرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژه‌های مهم یا ارجاع‌ها.

رایگان شروع کنید

چرا نوشتار دانشگاهی این آشکارسازها را به خطا می‌اندازد؟

پرسش‌های متداول ZeroGPT این‌گونه بیان می‌کند: «نوشتار بسیار صیقل‌خورده، فرمول‌وار، یا کم‌entropy می‌تواند شبیه AI باشد.» نثر دانشگاهی برای نوشتاری بسیار صیقل‌خورده، فرمول‌وار، و کم‌entropy طراحی شده است. یک بخش روش‌ها، یک مرور ادبیات، و یک نامه رسمی پوششی، همگی عبارت متعارف را بر عبارت ابتکاری ترجیح می‌دهند، زیرا همین عرف است که در وهله نخست سند را برای خواننده‌اش قابل استفاده می‌کند، و همین عرف دقیقاً همان الگوی کم‌entropy است که افشای خودِ فروشنده آن را به‌عنوان یک خطر نام می‌برد.

آزمایش‌های مستقل و داوری‌شده نشان می‌دهد که چرا این حالتِ خطا بر برخی نویسندگان بیش از دیگران اثر می‌گذارد. یک مطالعه Stanford در 2023 هفت آشکارساز پرکاربرد، از جمله ZeroGPT، را در برابر 91 انشای واقعی TOEFL که توسط گویشوران غیربومی انگلیسی نوشته شده بودند و 88 انشایی که توسط دانش‌آموزان پایه هشتم در US نوشته شده بودند، آزمود. ZeroGPT، 48 درصد از انشاهای TOEFL را به‌عنوان تولیدشده توسط AI علامت‌گذاری کرد، در برابر 0 درصد از انشاهای پایه هشتم، همان جهتِ خطا که هر آشکارساز در آن مطالعه نشان داد، فقط در مقیاسی متفاوت.

هیچ چیز در این شکاف مختص ZeroGPT نیست، و هیچ چیز در آن اطلاعات تازه‌ای هم نیست. این همان الگوی سوگیری علیه نویسندگان غیربومی است که در سراسر صنعت آشکارسازها مستند شده و در صفحه TextPulse درباره اینکه چرا آشکارسازهای AI علیه گویشوران غیربومی سوگیری دارند با جزئیات بیشتری پوشش داده شده است. آنچه این شکاف به‌طور مشخص درباره یک ابزار رایگان مصرفی نشان می‌دهد این است که محدودیتِ افشا‌شده توسط فروشنده، یعنی اینکه نوشتار با آنتروپی پایین به‌صورت ساخته‌شده توسط ماشین خوانده می‌شود، فرضی نیست. یک آزمون داوری‌شده سال‌ها پیش از آنکه FAQ کنونی شرکت این سازوکار را با واژگان خودش نام ببرد، وقوع آن را در همین محصول مشخص ثبت کرد.

آیا امتیاز یک آشکارساز رایگان می‌تواند چیزی را درباره یک سند واحد ثابت کند؟

به‌تنهایی، نه. یک درصد ZeroGPT به‌خودی‌خود درباره یک سند مشخص، در هیچ‌یک از دو جهت، اثبات‌کننده چیزی نیست. این فقط برآورد یک مدل است که بر پایه آزمون‌های داخلی ساخته شده، آزمون‌هایی که شرکت آن‌ها را در قالبی منتشر نکرده است که هر کسی بیرون از شرکت بتواند بررسی کند، و بر نوشتاری اعمال می‌شود که طول، تاریخچه ویرایش و ژانر آن همگی خوانش را به شیوه‌هایی تغییر می‌دهند که FAQ خودِ فروشنده از پیش آن را می‌پذیرد. برخورد کردن با یک امتیاز رایگانِ منفرد به‌عنوان حکم، از آن امتیاز بیش از چیزی می‌خواهد که شرکت صادرکننده برای آن ادعا می‌کند.

آنچه یک امتیاز واقعاً برای آن مفید است، محدودتر و عادی‌تر است: یک خوانش سریع و بی‌هزینه از این که پیش‌نویس در حال حاضر در همان نوع سنجش آماری که یک ابزار نهادی پولی نیز اجرا می‌کند، در چه جایگاهی قرار دارد، پیش از آن که هر کس دیگری آن را ببیند. ابزارهای رایگان TextPulse همان حوزه را به طور مستقیم پوشش می‌دهند، بدون آن که از نویسنده بخواهند حدس بزند از میان امتیازهای چند آشکارساز رایگان، ابتدا به کدام یک اعتماد کند.

اعداد دقت پنهان می‌کنند که خطاها بر سر چه کسانی فرود می‌آیند و چه چیزهایی آن‌ها را برمی‌انگیزد. دانستن زمان استفاده از a, an و the یکی از الگوهایی را که علامت را برمی‌انگیزد از میان برمی‌دارد، و این که مثبت کاذب دقیقاً چه معنایی دارد جداگانه توضیح داده شده است.

هیچ یک از این‌ها عدد ZeroGPT را بی‌معنا نمی‌کند، و هیچ یک از این‌ها عدد را به تنهایی کافی نمی‌سازد. یک امتیاز، برآوردی آغازین است که با روشی تولید می‌شود که شرکت آن را فقط به صورت کلی توصیف کرده و برای آزمون بیرونی باز نکرده است، بر روی نوشتاری که صرفاً ژانر آن می‌تواند نتیجه را پیش از آن که هر فرد درگیر کاری نادرست انجام داده باشد، تغییر دهد. دو واژه‌ای که بیشترین اطلاعات را در آن صفحه FAQ حمل می‌کنند، درصد نیستند. آن‌ها قیدهای احتیاطی هستند که درست کنار آن نشسته‌اند: internal، و pushing toward. یک امتیاز رایگان، نقطه آغاز گفت‌وگویی درباره یک پیش‌نویس است، نه استدلال پایانی در آن.

یافته‌های پژوهش خود ما

در مطالعه توافق آشکارسازهای TextPulse Research، نه آشکارساز تجاری هوش مصنوعی همان 90 متن دانشگاهی را ارزیابی کردند. یکی از آنها متنی ترکیبی با 455 واژه بود: آغاز و پایانی انسانی پیرامون بخش میانی 168 واژه‌ای تولیدشده با هوش مصنوعی. ZeroGPT به این متن نمره 7.6% هوش مصنوعی داد، در حالی که داوری ابزارهای دیگر درباره همان واژه‌ها از 0% تا 95.7% متغیر بود. مقاله کامل، پیکره و ماتریس نمرات هر ابزار به صورت آزاد در TextPulse Research در دسترس است.

ZeroGPT روی متن ترکیبی از پیکره مطالعه.
ZeroGPT روی متن ترکیبی از پیکره مطالعه.
XLinkedInFacebook

سؤالات متداول

دقت ZeroGPT، بر پایه ادعای کنونی خود شرکت، به نرخی می‌رسد که «به سمت >98% در ارزیابی‌های داخلی» پیش می‌رود. این رقم از آزمونی می‌آید که شرکت روی محصول خودش انجام داده است، نه از یک آزمایشگاه بیرونی، و پرسش‌های متداول خود فروشنده جداگانه یادآور می‌شود که نوشتار بسیار صیقل‌خورده یا قالبی می‌تواند صرف‌نظر از نویسنده، به صورت تولیدشده توسط AI خوانده شود.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

از تازه‌های انسان‌سازی AI باخبر بمانید

نکات مربوط به نگارش دانشگاهی، تشخیص AI و انسان‌سازی را در صندوق ورودی‌تان دریافت کنید.

بدون اسپم. هر زمان خواستید لغو اشتراک کنید.