AI Detection

نرخ مثبت کاذب Turnitin: اعداد چه می‌گویند

Turnitin دو رقم برای مثبت کاذب منتشر می‌کند، نه یکی، و هیچ‌کدام مقاله‌ای را که پیش روی یک استاد مشخص قرار دارد توصیف نمی‌کند. اینجا تفکیک سطح سند در برابر سطح جمله، ستاره مربوط به زیر 20 درصد، و محاسبه‌ای آمده است که کسری از یک درصد را به شمار واقعی دانشجویان تبدیل می‌کند.

5 min
Turnitin false positive rate: table comparing document-level and sentence-level figures and the sub-20-percent asterisk threshold

نرخ مثبت کاذب Turnitin یک عدد واحد نیست. این شرکت دو عدد منتشر می‌کند: یکی کمتر از 1 درصد در سطح سند، و دیگری نزدیک‌تر به 4 درصد در سطح جمله. هر دو واقعی‌اند، هر دو منتشر شده‌اند، و هیچ‌کدام به‌تنهایی چیز زیادی درباره مقاله مشخصی که پیش روی یک استاد مشخص قرار دارد نمی‌گویند.

این فاصله میان دو عدد، و آنچه رخ می‌دهد وقتی هر یک به‌جای یک سند منفرد بر یک کلاس واقعی اعمال شود، موضوعی است که این بخش آن را بررسی می‌کند: Turnitin خود چه می‌گوید، این دو عدد دقیقاً چه چیزهایی را پوشش می‌دهند، و آن محاسبه‌ای که کسری از یک درصد را به شمار واقعی دانشجویان تبدیل می‌کند.

نرخ مثبت کاذب Turnitin چیست، بر اساس گفته Turnitin؟

در سطح سند، به بیان خود شرکت: "Our document false positive rate, incorrectly identifying fully human-written text as AI-generated within a document, is less than 1% for documents with 20% or more AI writing." این شرط به همان اندازه عدد اهمیت دارد. این رقم کمتر از 1 درصد، ادعایی درباره هر مقاله‌ای که Turnitin نمره می‌دهد نیست. این رقم فقط آن دسته از مقاله‌ها را توصیف می‌کند که در برآورد خود مدل، از آستانه 20 درصد متن نوشته‌شده توسط AI عبور کرده‌اند.

در سطح جمله، جایی که رابط کاربری به‌جای یک سند کامل، خطوط منفرد را برجسته می‌کند، رقم خود Turnitin حدود چهار برابر بالاتر است. "Our sentence-level false positive rate is around 4%," شرکت می‌گوید. "There is a 4% likelihood that a specific sentence highlighted as AI-written might be human-written." Turnitin اضافه می‌کند که این جملات نادرست به‌صورت تصادفی پراکنده نمی‌شوند: در 54 درصد موارد، جمله‌ای که به‌اشتباه علامت‌گذاری شده است، درست کنار متن واقعی نوشته‌شده توسط AI قرار دارد، و شرکت این را بخشی از دلیل آن می‌داند که چرا امتیاز در سطح کل سند معمولاً بهتر از هر خط برجسته منفردی دوام می‌آورد.

سطح سند و سطح جمله یک ادعای یکسان نیستند

این تفکیک دو سطحی، پیام‌رسانیِ بازنگری‌شده است، نه موضع اصلی Turnitin. در زمان عرضه در آوریل 2023، این شرکت یک رقم واحدِ کمتر از 1 درصد را منتشر کرد، بدون هیچ تمایزی میان سند و جمله. پس از آنکه مؤسسات شروع کردند به استناد به آن عدد، و پس از آنکه مطبوعات آموزشی از مثبت‌های کاذبِ واقعیِ بالاتر از انتظار گزارش دادند، مدیر ارشد محصول Turnitin این تفکیکِ به‌کاررفته در بالا را منتشر کرد، همراه با دو تغییر محصول که در پاسخ انجام شد: افزایش حداقل طول سندِ قابل امتیازدهی از 150 به 300 کلمه، و تغییر شیوه امتیازدهی به جملات آغازین و پایانی در یک سند.

آستانه 300 کلمه‌ای به دلیلی مرتبط وجود دارد. Turnitin آن را از حداقل اولیه 150 کلمه افزایش داد، پس از آنکه دریافت, به گفته خود شرکت, دقت با افزایش متن بیشتر می‌شود. یک ارسال کوتاه، یک تأمل یک‌صفحه‌ای، یک پیش‌نویس ناقص، یک پست بحث، برای مدل نشانه کمتری فراهم می‌کند تا با آن کار کند نسبت به آنچه ارقام مثبت کاذبِ بالا بر پایه آن سنجیده شده بودند، و همین بخشی از دلیل آن است که هر چیزی زیر آن آستانه اصلاً هیچ امتیاز AI دریافت نمی‌کند، نه یک امتیاز غیرقابل اعتماد.

سطحنرخ اعلام‌شده Turnitinآنچه واقعاً پوشش می‌دهد
سطح سندکمتر از 1%فقط اسنادی که از پیش با 20% یا بیشترِ نوشته‌شده توسط AI علامت‌گذاری شده‌اند، درصد کلی برای کل ارسال
سطح جملهحدود 4%هر جمله منفردی که در گزارش نگارش AI برجسته شده باشد، صرف‌نظر از امتیاز کلی سند
زیر آستانه 20% سندهیچ عددی نشان داده نمی‌شودTurnitin به‌جای درصد، یک ستاره نمایش می‌دهد و نتیجه را در آن بازه کم‌اعتمادتر علامت‌گذاری می‌کند

مقاله خود را انسانی‌سازی کنید

متنِ کمک‌گرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژه‌های مهم یا ارجاع‌ها.

رایگان شروع کنید

محاسبه: معنای یک کسری از درصد برای یک گروه واقعی چیست

این محاسبه به‌صورت عمومی انجام شد، زمانی که Vanderbilt University در August 2023 نرخ‌های خطای مرتبط با تشخیص هوش مصنوعی Turnitin را محاسبه کرد. بهترین نمونه برای این‌که این محاسبه چگونه انجام می‌شود، محاسبه خود Vanderbilt از اعداد است. در یک پست وبلاگی درباره تصمیم خود برای خاموش کردن آشکارساز هوش مصنوعی Turnitin، آن‌ها اشاره کردند که «[i]n 2022 ما حدود 75,000 مقاله به Turnitin ارسال کردیم، که یعنی نرخ مثبت کاذب 1 درصدیِ اعلام‌شده توسط Turnitin به این معناست که حدود 750 مقاله دانشجویی ممکن بود به‌اشتباه به‌عنوان آثاری که بخشی از آن‌ها توسط هوش مصنوعی نوشته شده است برچسب بخورند.»

این رقم، برون‌یابی خود Vanderbilt از عدد منتشرشده توسط فروشنده است که بر حجم کاری خود Vanderbilt اعمال شده است، نه نتیجه‌ای که به‌طور جداگانه اندازه‌گیری شده باشد. ساختار این محاسبه فراتر از شمار دانشجویان یک دانشگاه تعمیم می‌یابد. نرخی کمتر از 1 درصد که بر چند صد مقاله اعمال شود، چند مورد دانشجوی به‌اشتباه علامت‌گذاری‌شده تولید می‌کند که به‌راحتی ممکن است نادیده گرفته شوند. همان نرخ اگر بر ده‌ها هزار مقاله اعمال شود، در مقیاسی که یک دانشگاه واقعی هر سال ارسال می‌کند، به‌جای چند مورد، صدها مورد تولید می‌کند، زیرا یک درصد کوچک و یک جمعیت بزرگ با هم ضرب می‌شوند، نه این‌که جداگانه در نظر گرفته شوند.

هیچ‌یک از این‌ها ثابت نمی‌کند که نرخ دنیای واقعی دقیقاً با رقم آزمایشگاهی یکسان است. مدیر ارشد محصول Turnitin خود به‌صورت عمومی پذیرفته است که نتایج دنیای واقعی با آزمون آزمایشگاهی تفاوت دارند، و این بخشی از دلیل بازنگری شرکت در پیام‌رسانی خود از ابتدا بوده است. محاسبه بالا عدد اعلام‌شده خود Turnitin را به‌عنوان ورودی‌ای در نظر می‌گیرد که ارزش جدی گرفتن دارد، نه به‌عنوان سقفی برای آنچه واقعاً رخ می‌دهد وقتی ابزاری در حال امتیازدهی به ارسال‌هایی است که هیچ شباهتی به یک معیار سنجش گزینش‌شده ندارند.

آنچه این نرخ پوشش نمی‌دهد

یک نتیجه زیر آستانه 20 درصد، یک درصد کوچک به آن ضمیمه نمی‌شود. به جای عدد، یک ستاره می‌گیرد، انتخابی که Turnitin انجام داد، زیرا آن بازه جایی است که این ابزار در هر دو جهت کمترین قابلیت اتکا را دارد، و این موضوع هم با گزارش مستقل رسانه‌های آموزشی و هم با صورت‌بندی خود شرکت از «اعتماد پایین» در همان بازه تأیید شده است. یک ویرایش سبک، یک پاراگراف که با کمک بازنویسی شده و بقیه بدون کمک نوشته شده‌اند، می‌تواند به جای یک عدد کوچک، اصلا هیچ نمره قابل مشاهده‌ای تولید نکند، و دانستن این نکته پیش از آنکه نبودِ عدد به‌عنوان یا یک اتهام یا یک گواه سلامت کامل خوانده شود، ارزشمند است. راهنمای TextPulse درباره اینکه چه چیزی یک نمره خوب Turnitin محسوب می‌شود همان آستانه را از سمت خواننده گزارش بررسی می‌کند.

پس یک نرخ مثبت کاذب منتشرشده را چگونه باید خواند؟

به‌عنوان عددی از سوی یک فروشنده درباره وضعیتی محدودتر از آنچه در نگاه نخست به نظر می‌رسد که توصیف می‌کند، نه به‌عنوان بیانیه‌ای درباره مقاله‌ای که پیش روی یک استاد خاص قرار دارد. Turnitin خروجی خود را نیز به همین شکل صورت‌بندی می‌کند: شرکت صریحا بیان می‌کند که فناوری تشخیص نوشتار AI آن «تشخیص تخلف» ارائه نمی‌دهد، بلکه فقط «داده‌هایی برای اینکه آموزگاران بتوانند تصمیمی آگاهانه بگیرند» فراهم می‌کند. شواهد گسترده‌تر درباره اینکه آیا آشکارسازهای AI اصلا دقیق هستند یا نه همین برداشت را تأیید می‌کند: یک نرخ منتشرشده یک معیار مرجع را توصیف می‌کند، نه سندی را که در حال حاضر در حال نمره‌دهی است.

نویسندگانی که می‌خواهند بدانند پیش‌نویس خودشان در همان نوع سنجش آماری کجا قرار می‌گیرد، به جای حدس زدن، می‌توانند آن را مستقیما با یک perplexity checker رایگان بررسی کنند، پیش از آنکه هر بخشی از آن به آشکارساز یک مؤسسه برسد. این کاربردی متفاوت از فناوری است نسبت به تلاش برای بحث کردن با یک نمره پس از وقوع، و همان جایی است که نویسنده، نه مدیر، نخستین بار عدد را می‌بیند.

دقت ZeroGPT جداگانه بررسی شده است برای هر کسی که مؤسسه‌اش از آن استفاده می‌کند. گروهی که این خطاها بیشترین آسیب را بر آن وارد می‌کنند، یعنی نویسندگان انگلیسی‌زبانِ غیربومی, موضوع صفحه‌ای جداگانه است.

جمعیتی که بیشترین مواجهه را با این محاسبه دارد نیز به طور یکنواخت پراکنده نیست. نویسندگان غیربومی انگلیسی بیشترین خطر مستند را برای قرار گرفتن در سمت نادرست هر یک از این درصدها دارند، و این دقیقاً همان مخاطبی است که صفحه TextPulse برای نویسندگان دانشگاهی ESL بر پایه آن ساخته شده است. Turnitin با بازآموزی مدل خود این ارقام را همچنان بازبینی خواهد کرد. چیزی که تغییر نخواهد کرد خودِ محاسبه است: نرخی با این کوچکی همچنان به جمعیتی با این بزرگی نیاز دارد تا در آن ناپدید شود، و بیشتر ارسال‌های واقعی چنین خوش‌اقبال نیستند.

XLinkedInFacebook

سؤالات متداول

نرخ مثبت کاذب Turnitin، بر اساس ارقام منتشرشده خود شرکت، یک عدد واحد نیست. در سطح سند، Turnitin نرخی کمتر از 1 درصد را بیان می‌کند، اما فقط برای اسنادی که از پیش با 20 درصد یا بیشتر به عنوان AI-written علامت‌گذاری شده‌اند. در سطح جمله، جایی که خطوط جداگانه برجسته می‌شوند، رقم خود شرکت حدود 4 درصد است.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

از تازه‌های انسان‌سازی AI باخبر بمانید

نکات مربوط به نگارش دانشگاهی، تشخیص AI و انسان‌سازی را در صندوق ورودی‌تان دریافت کنید.

بدون اسپم. هر زمان خواستید لغو اشتراک کنید.