AI Detection

Turnitin چگونه AI را تشخیص می‌دهد، گام به گام

آشکارساز نوشتار AI در Turnitin یک سند را به‌صورت یک کل واحد نمی‌خواند. این سامانه یک ارسال را به بخش‌هایی تقسیم می‌کند، به هر بخش جداگانه امتیاز می‌دهد، نتایج را میانگین می‌گیرد، و تنها سپس درصد را در گزارش تولید می‌کند. این متن آن خط لوله، آنچه را در میان ChatGPT، Claude و Gemini علامت‌گذاری می‌کند، آنچه آزمون مستقل نشان داده که از دست می‌دهد، و این‌که چه کسانی واقعاً می‌توانند آن عدد را ببینند، بررسی می‌کند.

18 min
How does Turnitin detect AI: diagram of the segment, score and average pipeline behind a Turnitin AI writing report

یک گزارش Turnitin می‌تواند تنها یک عدد برگرداند، مثلاً 42 درصد، و تقریباً هیچ چیز دیگری درباره این که چگونه به آن رسیده است نگوید، مگر آن که کسی به دنبال سازوکار پشت آن برود. آن عدد از کل سند به صورت مستقیم خوانده نمی‌شود و حدس هم نیست. این عدد پایان یک خط لوله مشخص و مستند است که در هر ارسال به همان شیوه اجرا می‌شود.

پس Turnitin چگونه AI را تشخیص می‌دهد؟ با شکستن یک ارسال به بخش‌ها، امتیازدهی جداگانه به آن‌ها بر پایه این که آیا احتمال دارد AI generated باشند یا AI generated و سپس paraphrased باشند، و میانگین گرفتن از آن امتیازها برای تعیین درصد کلی نمایش داده شده در گزارش. هر مرحله از آن خط لوله در مستندات خود Turnitin توضیح داده شده است، نه این که از بیرون reverse-engineered شده باشد.

این مشخصا درباره ویژگی تشخیص نوشتار AI در Turnitin است، یک سامانه جدا از بررسی قدیمی similarity یا plagiarism که یک ارسال را با اسناد دیگر مقایسه می‌کند. سازوکارهای زیر درون پرسش گسترده‌ترِ AI detectors actually work قرار می‌گیرند، و Turnitin یک نمونه عملی مفید است، دقیقاً چون بیش از بیشتر فروشندگان، روش خود را منتشر می‌کند. آنچه در ادامه می‌آید نخست خط لوله است، سپس این که در عمل چه چیزهایی را flag می‌کند، آزمون مستقل چه چیزهایی را نشان داد که از دست می‌دهد، و چه کسی درون یک مؤسسه در واقع نتیجه را می‌بیند.

Turnitin homepage positioning the product for authentic learning in an AI world, with AI writing detection and Turnitin Clarity featured
چارچوب‌بندی خود Turnitin: شناسایی نوشتار AI generated درون گردش کار similarity موجود، با Clarity به عنوان خط محصول متمرکز بر AI.

Turnitin چگونه AI را تشخیص می‌دهد؟ خط لوله به اختصار

آشکارساز نگارش هوش مصنوعی Turnitin چهار مرحله را به ترتیبی ثابت اجرا می‌کند. نخست، بررسی می‌کند که آیا یک سند به اندازه کافی متن نثرِ واجد شرایط دارد تا اصلا امتیازدهی شود یا نه. دوم، آن متن را به بخش‌هایی با چند صد واژه در هر بخش تقسیم می‌کند. سوم، یک مدل به هر بخش به طور جداگانه امتیاز می‌دهد. چهارم، امتیازهای بخش‌ها با هم میانگین گرفته می‌شوند تا درصد واحد در سطح سند به دست آید که خواننده واقعا می‌بیند.

گزارش نگارش هوش مصنوعی همان گزارش همانندی نیست

گزارش نگارش هوش مصنوعی Turnitin محصولی جدا از گزارش همانندی است که سرقت ادبی را بررسی می‌کند. این دو بر پایه مدل‌های متفاوت اجرا می‌شوند و در زبانه‌های متفاوتی در همان رابط نمایش داده می‌شوند. امتیاز همانندی، یک ارسال را با پایگاه داده‌ای از منابع پیش‌تر منتشرشده و دیگر مقاله‌های دانشجویی مقایسه می‌کند و درصدی را برمی‌گرداند که با آن مطابقت دارد. امتیاز هوش مصنوعی کار کاملا دیگری انجام می‌دهد: یک طبقه‌بند نثر را می‌خواند، به هر بخش امتیازگرفته احتمال تولیدشده توسط هوش مصنوعی بودن می‌دهد، و آن امتیازها را به یک درصد واحد در سطح سند تبدیل می‌کند. چون این دو چیزهای متفاوتی را می‌سنجند، یک ارسال می‌تواند امتیاز همانندی 2 درصد و امتیاز هوش مصنوعی 60 درصد داشته باشد، یا برعکس.

درصد هوش مصنوعی همچنین محدودتر از آن چیزی است که به نظر می‌رسد. این درصد نسبت نثر واجد شرایطی را توصیف می‌کند که مدل پیش‌بینی می‌کند توسط هوش مصنوعی نوشته شده است، نه کل سند را، زیرا بلوک‌های کد، فهرست‌های گلوله‌ای، تیترها و نگارش کوتاه‌فرم پیش از محاسبه امتیاز حذف می‌شوند. تا زمان نگارش این متن، آشکارساز فقط روی متن انگلیسی، اسپانیایی و ژاپنی اجرا می‌شود.

مرحله اول: بخش‌بندی سند به قطعه‌ها

پیش از آنکه هر چیزی امتیازدهی شود، مدل Turnitin ارسال را به قطعه‌هایی با چند صد واژه در هر قطعه تقسیم می‌کند، تقریبا پنج تا ده جمله برای هر قطعه. بخش‌بندی در ابتدا انجام می‌شود، زیرا مدل برای امتیازدهی به قطعه‌ای با این اندازه ساخته شده است، نه به یک جمله منفرد و نه به یک رساله کامل در یک نوبت.

فقط متن نثری در شمار یک chunk محسوب می‌شود. این مدل برای خواندن نوشتار بلند طراحی شده است. سندی که هم نثر و هم جدول یا کد را دربر می‌گیرد، به‌صورت دارای درصدی از متن نثری امتیازدهی می‌شود، اما ممکن است همه متن نثری موجود در سند را توصیف نکند. دلیل این امر آن است که detector در حال امتیازدهی به مجموعه‌ای از داده‌هاست که شامل بلوک‌های کد، bullet pointها، یا متن کوتاه نیست. به همین سبب ممکن است سند درصدی برگرداند که فقط بخشی از آنچه ارسال شده است را توصیف می‌کند.

امتیازدهی در سطح chunk پیامد کم‌صداتری هم دارد که شایسته نام بردن است. یک جمله منفرد که توسط AI پیش‌نویس شده و درون یک chunk دیگر که در غیر این صورت به‌دست انسان نوشته شده و چندصد واژه دارد قرار گرفته است، همراه با همه چیزهای دیگر در همان chunk میانگین‌گیری می‌شود، بنابراین اثر آن بر امتیاز خود آن chunk به اندازه‌ای که متن انسانی پیرامون، همان chunk را با آن به اشتراک می‌گذارد، رقیق می‌شود. یک درج کوتاهِ AI همچنان به model می‌رسد. فقط وزن آن کمتر از chunkی است که از نخستین واژه تا آخرین واژه‌اش توسط AI پیش‌نویس شده باشد.

گام دوم: امتیازدهی به هر بخش

هر chunk به‌طور مستقل، جدا از هر chunk دیگر در سند، امتیازدهی می‌شود. model پیش‌بینی می‌کند که آیا آن بازه مشخص از متن human-written است، AI-generated است، یا AI-generated و سپس paraphrased شده است، یعنی تمایزی سه‌حالته، نه یک بله یا خیر ساده.

این یک دسته‌بندی جداگانه است و صرفا امتدادی از AI-generated نیست، و نشان می‌دهد که paraphrasing واقعاً می‌تواند detection را تضعیف کند. این موضوع با یک مطالعه در 2023 پشتیبانی می‌شود که نشان داد عبور دادن متن AI-generated از یک model paraphrasing اختصاصی، یک detector پژوهشی به نام DetectGPT را از 70.3% دقت به 4.6% کاهش داد، در حالی که نرخ false-positive در 1% ثابت بود. به نظر نمی‌رسد Turnitin چیزی درباره میزان مقاومت classifier سه‌حالته خود در برابر همین تکنیک منتشر کرده باشد. این دسته‌بندی به دلیلی مستند وجود دارد.

امتیازدهی در سطح بخش، به جای سطح کل سند، یک انتخاب طراحی عمدی است. یک پایان‌نامه 90 صفحه‌ای با دو بند پیش‌نویس‌شده توسط AI و یک مقاله 5 صفحه‌ای که سراسر آن توسط AI پیش‌نویس شده است، مسئله‌های متفاوتی هستند، و میانگین‌گیری در میان بخش‌ها همان چیزی است که به یک عدد در سطح سند اجازه می‌دهد این تفاوت را بازتاب دهد، نه اینکه آن را هموار کند.

Turnitin معماری داخلی آن مدلِ مبتنی بر هر بخش را با همان میزان جزئیاتِ گام‌های خط لوله‌اش منتشر نکرده است. این یک طبقه‌بند نظارت‌شده است که بر روی نمونه‌های برچسب‌خورده آموزش دیده است، نه یک آستانه ساده بر نوع امتیاز خامِ توکن بعدی که در راهنمای TextPulse درباره اینکه perplexity در تشخیص AI در عمل چه چیزی را اندازه‌گیری می‌کند آمده است، هرچند همان ایده زیربنایی، یعنی متن به‌طور غیرعادی قابل پیش‌بینی، تقریباً قطعاً بخشی از چیزی است که چنین طبقه‌بندی‌کننده‌ای می‌آموزد به آن توجه کند.

گام سوم: میانگین‌گیری به یک درصد در سطح سند

امتیازهای بخش‌ها با هم میانگین گرفته می‌شوند تا همان درصد واحدی را بسازند که یک گزارش نمایش می‌دهد. آن درصد نمایانگر نسبت متن نثرِ واجد شرایط، فقط نوشتار بلند، است که مدل پیش‌بینی می‌کند توسط AI تولید شده یا توسط AI تولید شده و سپس بازنویسی شده است. این یک نسبت از بخش‌های امتیازدهی‌شده است، نه ادعایی مبنی بر اینکه سهم دقیقی از واژه‌های سند، به معنای تحت‌اللفظی، توسط یک ماشین تایپ شده‌اند.

درصدی که در گزارش آمده است، میانگین است. به همین دلیل است که دو سند که هر دو 40 درصد را نشان می‌دهند، ممکن است در بررسی نزدیک متفاوت به نظر برسند. یکی ممکن است 40 درصد از بخش‌هایش را به‌عنوان کاملاً تولیدشده توسط AI امتیاز گرفته باشد. دیگری ممکن است هر بخش را به‌صورت تا حدی محتمل امتیاز گرفته باشد و در نهایت به همان عدد اصلی برسد. این نشان نمی‌دهد کدام الگو آن را ایجاد کرده است.

Turnitin AI writing overview reporting 71% detected as AI, listing 18 segments as AI-generated only at 71% and zero segments as AI-paraphrased at 0%
خروجی آن گامِ میانگین‌گیری, یک درصد اصلیِ واحد, همراه با دو دسته زیر آن. در اینجا 71% به‌عنوان AI شناسایی شده است, که همه آن در دسته AI-generated only و هیچ‌کدام در AI-paraphrased نیست.

آیا Turnitin می‌تواند ChatGPT، Claude یا Gemini را شناسایی کند؟

معمولاً بله، وقتی یک سند حاوی مقدار قابل توجهی نوشتار AI باشد، و طبقه‌بند برایش مهم نیست که کدام فروشنده آن را تولید کرده است. Turnitin می‌گوید مدلش به دنبال الگوی نوشتاری است نه نام یک برند، و دامنه پوشش آن از زمان عرضه اولیه GPT-3.5 و GPT-4 در 2023 بارها گسترش یافته است. راهنمای فعلی، سری GPT-5، Gemini و Claude را در میان سامانه‌هایی نام می‌برد که مدل بر ضد آن‌ها آموزش دیده است، و نسخه‌های جدید مدل نیز به طور مستمر افزوده می‌شوند. دانشجویی که به جای آن از Gemini، Claude یا DeepSeek استفاده کرده باشد، صرفاً با انتخاب یک شرکت دیگر از شناسایی‌گر عبور نمی‌کند.

سهم ارسال‌هایی که این موضوع بر آن‌ها اثر می‌گذارد افزایش یافته است. حدود 15 درصد از مقاله‌هایی که Turnitin میان October 2025 و February 2026 اسکن کرد، 80 درصد یا بیشتر نوشتار تولیدشده توسط AI را نشان دادند، در حالی که این رقم هنگام عرضه ابزار در April 2023 حدود 3 درصد بود.

متن AI بازنویسی‌شده دسته‌بندی جداگانه خود را دارد و به سادگی از شناسایی معاف نمی‌شود، و این همان طبقه‌بندی سه‌گانه‌ای است که در بالا توصیف شد. مستندات Turnitin متنی را که آن را صرفاً تولیدشده توسط AI می‌داند از متنی که آن را تولیدشده توسط AI و سپس AI-paraphrased می‌داند جدا می‌کند، و در August 2025 شناسایی‌ای را افزود که به طور خاص متوجه ابزارهای AI bypasser است که برای بازنویسی خروجی ماشین به گونه‌ای طراحی شده‌اند که از شناسایی‌گر عبور کنند. این به آن معنا نیست که بازنویسی بی‌فایده است یا هر بخش بازنویسی‌شده‌ای شناسایی می‌شود. معنایش این است که این فرض که بازنویسی به طور پیش‌فرض برای Turnitin نامرئی است، مدت‌هاست که دیگر به‌روز نیست. آنچه این ابزار با متن بازنویسی‌شده به طور خاص و با خروجی DeepSeek انجام می‌دهد، جداگانه پوشش داده شده است.

مقاله خود را انسانی‌سازی کنید

متنِ کمک‌گرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژه‌های مهم یا ارجاع‌ها.

رایگان شروع کنید

حداقل تعداد واژه و آستانه ستاره‌دار

یک ارسال باید پیش از آنکه شناسایی‌گر AI در Turnitin اصلاً نمره‌ای تولید کند، دست‌کم 300 واژه متن نثرِ واجد شرایط داشته باشد، که این مقدار از حداقل پیشین 150 واژه افزایش یافته است. پایین‌تر از این طول، به سادگی متن کافی برای اجرای فرایند بخش‌بندی و میانگین‌گیری وجود ندارد.

آن آستانه 300 واژه با اندازه یک بخش امتیازدهی منفرد که پیش‌تر توصیف شد، یعنی چند صد واژه، پنج تا ده جمله، هم‌خوان است. یک سند که درست در حداقل قرار دارد، در واقع فقط به خط لوله به اندازه یک بخش از متن واجد شرایط برای میانگین‌گیری می‌دهد، نه چند بخش، و همین یکی از دلایلی است که چرا گزارشی که نزدیک آن آستانه قرار دارد، بیشتر احتمال دارد در بازه کم‌اعتمادتر بیفتد که آستانه بعدی برای علامت‌گذاری آن وجود دارد.

Turnitin همچنین درصدی را که پایین‌تر از آستانه 20% باشد نمایش نمی‌دهد. از July 2024، گزارش به جای یک عدد، یک ستاره را در کنار علامت درصد نشان می‌دهد. همین یک ویژگی از رفتار گزارش بیش از هر بخش دیگری از خط لوله باعث سردرگمی می‌شود، بنابراین در بخش جداگانه‌ای در ادامه به آن پرداخته می‌شود.

ConditionWhat the report showsWhy
Fewer than 300 words of qualifying proseNo AI score at allNot enough text for the segment-and-average pipeline to run on reliably
Score would fall below 20%An asterisk next to a percent sign, not a numberTurnitin's own documentation reports a measurably higher false-positive rate in that range
Score of 20% or higherA specific percentageConsidered reliable enough by Turnitin to display as a number

علامت ستاره در Turnitin چه معنایی دارد؟

یک ستاره در گزارش نگارش AI در Turnitin یعنی مدل مقداری نگارش AI را تشخیص داده است، اما کمتر از 20 درصد سند، و Turnitin از انتشار یک عدد در آن بازه خودداری می‌کند. جایی که معمولاً یک درصد قرار می‌گیرد، گزارش به جای آن یک ستاره در کنار علامت درصد نشان می‌دهد. مستندات محصول خود Turnitin این موضوع را به‌صراحت بیان می‌کند: "When AI is detected below the 20% threshold in the report, it is now indicated with an asterisk (*%) and no percentage is attributed."

بنابراین، یک ستاره نه خطاست، نه نشانه‌ای از نبودِ امتیاز، و نه علامتی که چیزی در بارگذاری اشتباه شده است. این یک تصمیم عمدی از سوی فروشنده است برای پنهان کردن عددی که آن را به اندازه کافی قابل اعتماد برای چاپ نمی‌داند.

چرا Turnitin عدد زیر 20 درصد را پنهان می‌کند

زیرا این بازه جایی است که ابزار بیشترین احتمال خطا را دارد، و وعده دقت خود Turnitin نیز به گونه‌ای تعریف شده است که آن را مستثنا کند. شرکت متعهد می‌شود نرخ مثبت کاذب خود را «زیر 1% برای اسنادی با بیش از 20% نوشتار AI» نگه دارد. دامنه این تعهد را با دقت بخوانید: درون آن یک کف در نظر گرفته شده است، و آن کف همان 20 درصد است. پایین‌تر از آن خط، شرکت همان سطح از قابلیت اعتماد را ادعا نمی‌کند، بنابراین به جای چاپ یک عدد کوچک که خواننده ناگزیر آن را دقیق تلقی می‌کند، اصلا چیزی چاپ نمی‌کند. ستاره برای جلوگیری از مثبت‌های کاذب وجود دارد، یعنی برای جلوگیری از این که به یک مدرس عددی داده شود که یک سند نوشته‌شده توسط انسان را نادرست نشان دهد.

این استدلال با سازوکارهایی که پیش‌تر توصیف شد همخوان است. امتیاز در سطح سند، میانگینی از بخش‌هایی با چند صد واژه است. وقتی فقط سهم کوچکی از آن بخش‌ها به عنوان AI امتیاز می‌گیرند، میانگین حاصل بر سیگنال بسیار اندکی استوار است، و خط لوله نمی‌تواند به طور قابل اعتماد یک 8 درصد واقعی را از یک 8 درصد کاذب جدا کند. پنهان کردن عدد، پاسخ صادقانه به این وضعیت است، و همان منطق پشت حداقل 300 واژه نیز همین است.

ستاره در عمل در یک دانشگاه چه معنایی دارد

در عمل، بیشتر مؤسسات یک ستاره را چیزی نمی‌دانند که لازم باشد بر اساس آن اقدامی انجام دهند، و آن را به منزله امتیاز پایینی می‌خوانند که با کار نوشته‌شده توسط انسان سازگار است. استدلال روشن است. اگر فروشنده‌ای که آشکارساز را ساخته است حاضر نباشد از عددی در آن بازه دفاع کند، یک مدرس چیزی ماهوی برای مطرح کردن با دانشجو ندارد، چه برسد به چیزی برای بردن به کمیته تخلف. برای بیشتر فرایندهای یکپارچگی دانشگاهی، گزارشی که یک ستاره نشان می‌دهد از نظر کارکردی معادل یک گزارش پاک است.

این توصیفی از نحوه استفاده از نتیجه است، و دانستن آن اگر به چنین گزارشی خیره شده‌اید ارزش دارد. این با داوری درباره این که خود سند واقعا چیست یکسان نیست، و این تمایز در هر دو جهت اهمیت دارد.

آنچه ستاره به معنای آن نیست

  • این نشانه، گواهیِ تألیف انسانی نیست. Turnitin از دادنِ امتیازِ مطمئن به سند خودداری می‌کند، و این گزاره‌ای درباره آشکارساز است نه درباره نویسنده.
  • این نشانه، همان صفر نیست. یک سند که هیچ نگارشِ AI در آن نیست و سندی که یک بندِ یاری‌گرفته از AI دارد، می‌توانند همان ستاره را تولید کنند، و دقیقاً به همین دلیل است که عدد نمایش داده نمی‌شود.
  • این نشانه، میانِ ارسال‌ها قابل مقایسه نیست. دو ستاره فقط به شما می‌گویند هر دو سند زیرِ همان آستانه قرار گرفته‌اند، و هیچ چیز درباره مقایسه آن‌ها با یکدیگر نمی‌گویند.
  • این نشانه، نمره شباهت نیست. تطبیقِ سرقت ادبی گزارشی جداگانه در زبانه‌ای جداگانه است، و درصدِ خودش را، مستقل از آنچه نشانگر AI انجام می‌دهد، نمایش می‌دهد.

پیامد عملیِ مهمی که باید به خاطر سپرد این است که یک ویرایشِ سبکِ یاری‌گرفته از AI, یعنی بازنویسیِ یک بند با کمک و نوشتنِ بقیه بدون یاری، اغلب به جای درصدی کوچک، یک ستاره تولید می‌کند. نه وجودِ یک عدد و نه نبودِ آن، به تنهایی مسئله را حل نمی‌کند، و همین همان نتیجه‌ای است که ارقامِ دقتِ زیر از جهتِ دیگر به آن می‌رسند.

Turnitin درباره دقت چه ادعایی می‌کند، و این اعداد از آنِ چه کسی هستند

Turnitin ارقامِ دقتِ خود را منتشر می‌کند، و باید آن‌ها را دقیقاً به همین معنا خواند, یعنی اعدادِ اعتبارسنجیِ خودِ فروشنده، نه یک حسابرسیِ مستقل. مواد منتشرشده آن نرخِ مثبتِ کاذبِ زیرِ 1% را برای اسنادی بیان می‌کند که مدل برای آن‌ها بیش از 20% نگارشِ AI امتیاز می‌دهد، آستانه‌ای که با حدِ ستاره‌ایِ توصیف‌شده در بالا هم‌راستا است. همان برنامه بعدتر در پاسخ به پژوهش درباره سوگیریِ آشکارساز، به نمونه‌های نوشتاریِ زبان‌آموزانِ انگلیسی نیز گسترش یافت.

Turnitin می‌گوید این رقم را در برابر یک خط پایه بزرگ از مقالات نوشته‌شده توسط انسان که پیش از وجود ChatGPT ارسال شده بودند، اعتبارسنجی کرده است. مواد Turnitin درباره اندازه دقیق آن خط پایه ناسازگارند، صفحه FAQ به 700,000 مقاله اشاره می‌کند، در حالی که یک پست وبلاگی از Chief Product Officer در Turnitin به 800,000 مقاله اشاره می‌کند، و همان ادعای کمتر از 1% به هر دو نسبت داده شده است. مواد Turnitin همچنین، بنا بر روایت خود شرکت، یک مبادله را توصیف می‌کنند, یعنی شناسایی تهاجمی‌تر محتوای تولیدشده توسط AI به معنای از دست دادن حدود 15% از آن است.

این شرکت همچنین ادعاهای خود را در فضای عمومی بازنگری کرده است. در 2023، اندکی پس از عرضه، chief product officer در Turnitin اذعان کرد که آزمون‌های آزمایشگاهی پیش‌بینی نکرده بودند در استفاده واقعی چه تعداد مثبت کاذب ظاهر خواهد شد، به‌ویژه در ارسال‌های کوتاه، و نرخ مثبت کاذب در سطح جمله را حدود 4 percent گزارش کرد. افزایش حداقل طول قابل امتیازدهی از 150 به 300 واژه پاسخ به آن شکاف بود.

این ارقام در کنار هم، یک مبادله مشخص را توصیف می‌کنند، نه یک عدد واحد برای دقت. نرخ مثبت کاذب کمتر از 1% تا زمانی که در برابر تعداد ارسال‌هایی که از سامانه عبور می‌کنند مقیاس نشود، نزدیک به ناچیز به نظر می‌رسد، و نرخ از دست‌دادن 15% یعنی بخش معناداری از محتوای تولیدشده توسط AI بنا بر طراحی، نه بر اثر نقص، به‌عنوان انسانی امتیازدهی می‌شود. مواد خود Turnitin هر دو عدد را به‌عنوان توازن مورد نظر سامانه ارائه می‌کنند، نه به‌عنوان شواهدی که ابزار صرفاً درست یا صرفاً نادرست است.

آنچه آزمون مستقل یافت

آزمون مستقل جزئیاتی را اضافه می‌کند که ارقام فروشنده ارائه نمی‌کنند، در همان روحِ آزمون مستقل آشکارسازهای AI گسترده‌تر که همچنان شکاف‌هایی میان شرایط آزمایشگاهی و ارسال‌های واقعی را نشان می‌دهد. Center for the Advancement of Teaching در Temple University یکی از دقیق‌ترین بررسی‌های موجود را انجام داد. پژوهشگران 120 نمونه نوشتاری را ارسال کردند، که به‌طور مساوی میان نوشتار کاملاً انسانی، نوشتار کاملاً تولیدشده توسط AI، نوشتار تولیدشده توسط AI که از یک ابزار بازنویسی عبور داده شده بود، و متن‌های ترکیبیِ شامل مشارکت‌های انسانی و AI تقسیم شده بودند، و آنچه Turnitin برای هرکدام بازگرداند را ثبت کردند.

این ابزار 93 درصد از نمونه‌های کاملا انسانی و 77 درصد از نمونه‌های کاملا تولیدشده توسط AI را به‌درستی شناسایی کرد. در پرسش‌های دشوارتر، دقت باز هم کاهش یافت. Turnitin تنها 63 درصد از نمونه‌های AI بازنویسی‌شده را به‌درستی به‌عنوان تولیدشده توسط AI شناسایی کرد، و فقط 43 درصد از نمونه‌های ترکیبی را نه کاملا انسانی و نه کاملا AI تشخیص داد. این‌ها نزدیک‌ترین دسته‌ها به شیوه‌ای هستند که نوشتارِ کمک‌گرفته از AI در عمل تولید می‌شود، و پژوهشگران به‌ویژه متن ترکیبی را به‌عنوان موردی که احتمال دارد سهمی بزرگ و رو به رشد از ارسال‌های واقعی را تشکیل دهد برجسته کردند، زیرا هرچه تعداد درس‌هایی که کاری را که از AI برای بخشی از تکلیف استفاده می‌کند واگذار می‌کنند بیشتر شود.

چه چیزی آزموده شدنتیجه Turnitin
نمونه‌های 100% نوشته‌شده توسط انسان93% به‌درستی به‌عنوان انسانی شناسایی شد
نمونه‌های 100% تولیدشده توسط AI77% به‌درستی به‌عنوان AI شناسایی شد
متن AI که از یک ابزار بازنویسی عبور داده شد63% به‌درستی به‌عنوان AI شناسایی شد
نمونه‌های ترکیبی، بخشی انسانی و بخشی AI43% به‌درستی به‌عنوان نه 0% و نه 100%
اسنادی با بیش از 20% علامت‌گذاری‌شده، رقم خود Turnitinنرخ مثبت کاذب زیر 1%

هیچ‌یک از این‌ها یافته‌های مستقل از سوی Turnitin نیستند. پژوهشگران خارج از شرکت، که در گزارش‌های مربوط به مطالعات سوگیری خود Turnitin به آن‌ها استناد شده است، تصویری باز هم پیچیده‌تر توصیف می‌کنند، به‌ویژه برای نویسندگان غیربومی انگلیسی و پیش‌نویس‌هایی که به‌شدت ویرایش شده‌اند.

جایی که برجسته‌سازی‌های سطح جمله از کار می‌افتند

امتیاز در سطح سند تنها نمایی نیست که یک مدرس می‌تواند باز کند، و نمای دیگر کمتر قابل اعتماد است. برخی رابط‌ها گزارشی از پرچم‌گذاری نشان می‌دهند که جملات مشخص را به عنوان جملات محتملِ نوشته‌شده توسط AI برجسته می‌کند. پژوهشگران Temple این برجسته‌سازی‌ها را با این که کدام جملات در نمونه‌های ترکیبی آنان واقعاً توسط AI نوشته شده بودند مقایسه کردند و هیچ رابطه‌ای میان این دو نیافتند. این موضوع اهمیت دارد اگر یک مدرس به جای درصد خلاصه، از یک پاراگراف برجسته‌شده اسکرین‌شات بفرستد: امتیاز کلی سند به طور قابل توجهی بهتر از برجسته‌سازی‌های سطح جمله عمل کرد.

چه کسانی واقعاً امتیاز را می‌بینند

امتیاز AI به طور پیش‌فرض بخشی از گزارشِ قابل مشاهده برای دانشجو نیست. این امتیاز در تب جداگانه خود قرار دارد، برای مدرسان و مدیران قابل مشاهده است، و دانشجو آن را فقط در صورتی می‌بیند که مدرس تصمیم بگیرد گزارش را به اشتراک بگذارد یا آن را مستقیماً نمایش دهد. این یک تفاوت ساختاری واقعی با امتیاز شباهت است، زیرا دانشجویان معمولاً می‌توانند پس از پردازش یک ارسال، خودشان آن را در همان سامانه مشاهده کنند.

همین امر درباره این که آیا این ویژگی اصلاً برای یک درس مشخص وجود دارد یا نه نیز صدق می‌کند، که تصمیمی نهادی است و فراتر از اختیار مدرس قرار دارد. مدیران در سطح حساب کاربری می‌توانند تشخیص AI در Turnitin را برای یک مؤسسه کامل روشن یا خاموش کنند. ممکن است یک مدرس نتواند آن را روشن کند اگر دانشگاه او آن را خاموش کرده باشد، و برعکس. دو دانشجو در دو دانشگاه متفاوت می‌توانند کارهای قابل مقایسه‌ای ارائه دهند و تجربه‌های بسیار متفاوتی از این ابزار داشته باشند، به دلایلی که هیچ ربطی به آنچه هر یک نوشته‌اند ندارد.

چرا برخی دانشگاه‌ها آن را خاموش کرده‌اند

University of Waterloo در سپتامبر 2025 ویژگی تشخیص AI در Turnitin را متوقف کرد، و دلیل‌گذاری منتشرشده آن به طور غیرمعمولی صریح است. دانشگاه به غیرقابل‌اعتماد بودن مستندِ این ابزار، سوگیری آن علیه دانشجویانی که زبان اولشان English نیست، و آزمون‌های داخلی خود اشاره کرد، که دست‌کم یک مورد از متن کاملاً انسانی را شامل می‌شد که 100 percent AI-generated امتیاز گرفته بود. دانشگاه با در نظر گرفتن هزینه این ابزار، به این نتیجه رسید که هزینه‌ها از مزایا بیشتر است و در عوض تلاش را به سمت بازطراحی ارزیابی و آموزش سواد AI هدایت کرد.

واترلو یک نمونه آشکار از یک شکاف گسترده‌تر است، نه یک مورد استثنایی. دانشگاه‌هایی که این ویژگی را روشن نگه می‌دارند، عموماً به جای آنکه امتیاز را به‌تنهایی یک حکم نهایی بدانند، برای آن حفاظ‌هایی افزوده‌اند، از دانشجو پیش از آغاز هر فرایند رسمی گفت‌وگو می‌خواهند و عدد را دلیلی برای گشودن آن گفت‌وگو می‌دانند، نه بستن آن. مطالعه درباره اینکه دانشگاه‌ها چگونه سیاست AI را مدیریت می‌کنند به‌طور گسترده‌تر، این الگو را روشن‌تر می‌کند: اینکه اصلاً یک امتیاز به شما برسد یا نه، به تصمیمی بستگی دارد که بسیار بالاتر از کلاس سمینار شما گرفته شده است، نه به ویژگی ثابتی از خود فناوری.

یک امتیاز بالا چه چیزی را ثابت می‌کند و چه چیزی را ثابت نمی‌کند

یک امتیاز بالای AI یک قرینه است، نه یک حکم نهایی. Turnitin خودِ این درصد را به‌عنوان یکی از داده‌ها برای قضاوت مدرس صورت‌بندی می‌کند، نه به‌عنوان یافته‌ای درباره تخلف، و ارقام دقت بالا توضیح می‌دهند که چرا این صورت‌بندی اهمیت دارد: حتی امتیاز در سطح سند که نسبتاً خوب عمل می‌کند، بخش معناداری از نوشتارهای به‌شدت ویرایش‌شده، بازنویسی‌شده یا ترکیبی را به‌اشتباه می‌خواند، و برجسته‌سازی‌های در سطح جمله به‌مراتب کم‌اعتمادتر از عدد خلاصه هستند. هیچ‌یک از این‌ها تضمین نمی‌کند که هر امتیاز منفردی نادرست است. معنایش این است که یک درصد، دلیلی برای پرسش‌کردن است، نه یافته‌ای که بتوان آن را در نگاه اول پذیرفت.

یک درصد منفرد در سطح سند، چهار گام جداگانه را در یک عدد فشرده می‌کند، و هیچ‌یک از این گام‌ها معنا را نمی‌خوانند یا بررسی نمی‌کنند که آیا استدلال درست است یا نه. دیدن اینکه یک قطعه کوتاه بر اساس سیگنال‌های آماری زیربنایی که چنین خط لوله‌ای از آن ساخته شده است چگونه امتیاز می‌گیرد، راهی مستقیم‌تر برای فهم یک گزارش است تا اینکه درصد را یک حکم نهایی بدانیم. بررسی‌کننده رایگان perplexity در TextPulse نسخه‌ای ساده‌شده از همین نوع امتیازدهی در سطح واژه را بر روی پیش‌نویس خود شما، بیرون از هر خط لوله نهادی، اجرا می‌کند، و بررسی‌کننده رایگان burstiness آن نیمه مربوط به ریتم جمله را در همان سنجش پوشش می‌دهد. هر دو به شما خوانشی از نوشته خودتان می‌دهند، نه پیش‌بینی اینکه Turnitin درباره آن چه خواهد گفت. هیچ ابزاری نمی‌تواند به‌طور مسئولانه چنین وعده‌ای درباره سامانه‌ای که آن را کنترل نمی‌کند بدهد.

Turnitin دو عدد گزارش می‌کند و این دو عدد چیزهای نامرتبطی را اندازه‌گیری می‌کنند. اینکه کدام کدام است جداگانه توضیح داده شده است, همراه با اینکه در عمل چه چیزی به عنوان یک نمره خوب Turnitin محسوب می‌شود، وقتی بدانید این درصد به چه چیزی اشاره دارد. چند پرسش مرتبط دیگر نیز صفحه‌های جداگانه دارند: اینکه آیا یک استاد می‌تواند تشخیص دهد شما از ChatGPT استفاده کرده‌اید، حتی بدون هیچ آشکارساز دیگری، نسخه صریح‌تر آن، آیا من گیر می‌افتم، و برای زمینه‌های خاص، تشخیص AI در برنامه‌های پرستاری و اینکه آیا دفاتر پذیرش دانشگاهی این بررسی‌ها را انجام می‌دهند. چارچوب‌بندی گسترده‌تر در نوشته‌ای جداگانه درباره یکپارچگی دانشگاهی و AI آمده است.

هیچ‌یک از این‌ها به احتمال زیاد نسخه نهایی نیست. Turnitin از 2023 تاکنون بیش از یک بار آستانه‌های خود، قواعد نمایش و پوشش مدل‌هایش را بازنویسی کرده است، و August 2026 نیز آخرین سخن نخواهد بود. این ابزار در کنار سایر مجموعه ابزارهای رایگان TextPulse قرار دارد، برای هر کسی که پیش از آنکه درصد یک مؤسسه را سخن نهایی بداند، بخواهد یک نشانه دوم داشته باشد.

یافته‌های پژوهش خود ما

در مطالعه توافق آشکارسازهای TextPulse Research، نه آشکارساز تجاری هوش مصنوعی همان 90 متن دانشگاهی را ارزیابی کردند. یکی از آنها متنی ترکیبی با 455 واژه بود: آغاز و پایانی انسانی پیرامون بخش میانی 168 واژه‌ای تولیدشده با هوش مصنوعی. Turnitin به این متن نمره 26.8% هوش مصنوعی داد، در حالی که داوری ابزارهای دیگر درباره همان واژه‌ها از 0% تا 95.7% متغیر بود. مقاله کامل، پیکره و ماتریس نمرات هر ابزار به صورت آزاد در TextPulse Research در دسترس است.

Turnitin روی متن ترکیبی از پیکره مطالعه.
Turnitin روی متن ترکیبی از پیکره مطالعه.
XLinkedInFacebook

سؤالات متداول

Turnitin چگونه AI را تشخیص می‌دهد؟ این سامانه یک ارسال را به بخش‌هایی با چند صد واژه تقسیم می‌کند، هر بخش را جداگانه از نظر این‌که آیا AI-generated یا AI-generated-and-then-paraphrased به نظر می‌رسد امتیازدهی می‌کند، سپس آن امتیازهای بخشی را به یک درصد واحد که در گزارش نشان داده می‌شود میانگین می‌گیرد. این فرایند برای هر ارسالی که حداقل تعداد واژه را داشته باشد به همان شکل اجرا می‌شود.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

از تازه‌های انسان‌سازی AI باخبر بمانید

نکات مربوط به نگارش دانشگاهی، تشخیص AI و انسان‌سازی را در صندوق ورودی‌تان دریافت کنید.

بدون اسپم. هر زمان خواستید لغو اشتراک کنید.