AI Detection

Turnitin Similarity Score در برابر AI Score: دو گزارش متفاوت

یک similarity score و یک AI score به پرسش‌های متفاوتی پاسخ می‌دهند، بنابراین یک مقاله می‌تواند در یکی نمره پایین و در دیگری نمره بالا بگیرد، بی‌آنکه هیچ‌یک از این دو عدد نادرست باشد. هر کدام چه چیزی را می‌سنجد، چه چیزی آن را فعال می‌کند، و یک عدد بالا چه چیزی را ثابت می‌کند و چه چیزی را ثابت نمی‌کند.

به‌روزرسانی شده در 5 min
Turnitin similarity vs AI score comparison chart showing two independent report numbers

یک گزارش با دو عدد روی آن می‌رسد: نمره شباهت 3 درصد و نمره AI 88 درصد. برداشت طبیعی این است که باید در حال اندازه‌گیری یک چیز باشند، پس عدد پایین باید یعنی عدد بالا هم احتمالاً نادرست است. اما این‌گونه کار نمی‌کند. Turnitin similarity vs AI score مقایسه‌ای میان دو سامانه جداگانه است که دو چیز جداگانه را بررسی می‌کنند، و یک ارسال می‌تواند در یکی نمره پایین و در دیگری نمره بالا بگیرد، بی‌آنکه هیچ‌یک از این دو عدد خطا باشد.

این سامانه از سامانه AI قدیمی‌تر است و برای شناسایی متنی ساخته شده که با چیزی که از پیش وجود دارد تطابق دارد. سامانه AI جدیدتر است و به‌عنوان سنجشی مستقل در همان Similarity Report افزوده شده است، و برای برآورد این ساخته شده که آیا نثر شبیه متن تولیدشده توسط ماشین خوانده می‌شود یا نه، صرف‌نظر از این‌که اصلاً با چیزی تطابق داشته باشد یا نه. بنا بر مستندات خود Turnitin، این دو کاملاً مستقل‌اند و بر یکدیگر اثر نمی‌گذارند. همه چیز دیگر در این نوشته.

Turnitin similarity report showing 12% overall similarity, with match groups of 115 not cited or quoted at 9% and 41 missing quotations at 3%, top sources across internet, publications and student papers, and zero integrity flags
Similarity report به یک پرسش پاسخ می‌دهد: چه مقدار از این متن با چیزی که از پیش در پایگاه‌های داده Turnitin وجود دارد تطابق دارد. در اینجا این مقدار 12% است، که به گروه‌های تطابق و منابع تقسیم شده است، و هیچ پرچم یکپارچگی‌ای ثبت نشده است.
نمای کلی نگارش AI در Turnitin که 71% را به‌عنوان AI نشان می‌دهد، شامل 18 بخش که فقط در 71% به‌صورت AI-generated علامت‌گذاری شده‌اند و صفر بخش که به‌صورت AI-paraphrased علامت‌گذاری شده‌اند، در کنار هشداری که می‌گوید بازبینان باید محدودیت‌های تشخیص AI را درک کنند
گزارش نگارش AI یک سند جداگانه با شماره مخصوص خود است. همان مقاله 71% را به‌عنوان AI نشان می‌دهد، که میان AI-generated only و AI-paraphrased text تقسیم شده است، و هشدار خود Turnitin درباره محدودیت‌های تشخیص نیز در کنار آن چاپ شده است.

Similarity در Turnitin در برابر AI Score: هر عدد چه چیزی را گزارش می‌کند

Turnitin این دو را به‌عنوان دو سنجش متفاوت در نظر می‌گیرد که در یک محصول واحد گرد آمده‌اند، نه دو نمای متفاوت از یک نتیجه. Similarity Report یک ارسال را با پایگاه داده‌ای از محتوای وب، انتشارات دانشگاهی، و مقاله‌های دانشجویی که پیش‌تر ارسال شده‌اند مقایسه می‌کند، و درصدی از متن ارسال را که با چیزی از پیش در آن پایگاه داده مطابقت دارد بازمی‌گرداند. تشخیص نگارش AI یک مدل کاملاً متفاوت را اجرا می‌کند که به همان گزارش افزوده شده است و امتیاز مستقل خود را دارد، مدلی که برای سنجش این‌که نثر یک بخش تا چه اندازه به نوشتار تولیدشده توسط ماشین شباهت دارد آموزش دیده است، بدون هیچ ارجاعی به هیچ پایگاه داده خارجی. سازوکار کامل‌تر این‌که طبقه‌بند AI در Turnitin چگونه به آن عدد می‌رسد جداگانه توضیح داده شده است، آنچه در اینجا اهمیت دارد این است که این بخش به پرسشی متفاوت از موتور similarity پاسخ می‌دهد که در همان گزارش قرار دارد.

Similarity Score در عمل چه چیزی را اندازه‌گیری می‌کند

Similarity یک تمرین تطبیق است، نه یک داوری. راهنمای خود Turnitin صریح است که این ابزار plagiarism را بررسی نمی‌کند. این ابزار هم‌پوشانی را بررسی می‌کند و تفسیر را به مدرس یا استاد خواننده گزارش واگذار می‌کند. یک نقل‌قول که به‌درستی از متن جدا شده باشد، عبارتی در بخش روش‌ها که در سراسر یک زیرشاخه علمی مشترک است، فهرست منابعی که به همان شیوه‌ای قالب‌بندی شده که هر مقاله در آن مجله فهرست منابع خود را قالب‌بندی می‌کند: همه این‌ها می‌توانند به‌صورت یک match ثبت شوند، زیرا سیستم رشته‌های هم‌پوشان متن را می‌شمارد، نه این‌که داوری کند آیا این هم‌پوشانی مشروع است یا نه.

این نیز دلیل دیگری است که چرا نمره شباهتِ صفر کمتر از آنچه به نظر می‌رسد، اثبات می‌کند. این یعنی ارسال‌شده هیچ بخش بلند و پیوسته‌ای از متن را که در منابع نمایه‌شده Turnitin در جای دیگری یافت شده باشد، در بر ندارد. این نمره هیچ چیز درباره این نمی‌گوید که جمله‌های موجود چگونه تولید شده‌اند، زیرا تولید جمله‌ای که با هیچ چیز در یک پایگاه داده مطابقت نداشته باشد، همان مهارتی نیست که تولید جمله‌ای را ممکن می‌کند که یک مدل زبانی آن را پیش‌بینی نمی‌کرد.

مقاله خود را انسانی‌سازی کنید

متنِ کمک‌گرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژه‌های مهم یا ارجاع‌ها.

رایگان شروع کنید

نمره AI در واقع چه چیزی را می‌سنجد

نمره AI هیچ پایگاه داده‌ای برای مقایسه ندارد. یک طبقه‌بند نثرِ ارسال‌شده را می‌خواند و بر پایه الگوهایی که از نمونه‌های نوشتار انسانی و تولیدشده توسط AI آموخته است، برآورد می‌کند که این نثر تا چه اندازه احتمال دارد از یک مدل آمده باشد نه از یک انسان. هیچ بخشی از این برآورد به این وابسته نیست که آیا همان جمله دقیق پیش‌تر در جایی ظاهر شده است یا نه. یک جمله می‌تواند کاملا یکتا باشد، تا پیش از این ارسال هیچ‌کس آن را تایپ نکرده باشد، و با این حال اگر انتخاب واژه‌ها و ریتم آن از الگویی پیروی کند که یک مدل زبانی معمولا تولید می‌کند، از نظر آماری شبیه خروجی AI به نظر برسد.

این همان قلمرو آماری است که در شرح گسترده‌ترِ اینکه آشکارسازهای AI در عمل چگونه کار می‌کنند به طور کامل پوشش داده می‌شود، یعنی پیش‌بینی‌پذیری در سطح واژه و ریتم در سطح جمله، که در یک نمره سندی واحد ادغام شده‌اند. نسخه Turnitin از آن طبقه‌بند اختصاصی است، اما فرض بنیادین آن، یعنی اینکه متن تولیدشده از نظر آماری معمولا معمولی‌تر از نوشتار انسانی است، همان فرضی است که در پسِ هر ابزار این دسته قرار دارد.

امتیاز شباهتامتیاز AI
چه چیزی را می‌سنجداینکه چه مقدار از متنِ ارسال‌شده با دیگر اسناد نمایه‌شده مطابقت دارداینکه نثر تا چه اندازه شبیه نوشتارِ آماریِ معمولِ تولیدشده توسط AI است
چه چیزی عدد بالا را فعال می‌کندنقل‌قول‌های طولانی، عبارت‌پردازی‌های رایجِ خاصِ حوزه، مطالبِ بازاستفاده‌شده، یا تطابق با یک ارسالِ پیشینریتم یکنواختِ جمله‌ها و انتخاب‌های واژگانیِ به‌طور مداوم قابل‌پیش‌بینی در سراسر سند
آنچه عدد بالا ثابت نمی‌کنداینکه متنِ مطابق‌شده به‌طور نادرست استفاده شده است. مطالبی که به‌درستی ارجاع داده شده‌اند نیز همچنان می‌توانند به‌صورت تطابق ثبت شوند.اینکه هر جملهٔ منفردی توسط AI تولید شده است. این طبقه‌بند الگوی کلیِ سند را می‌خواند، نه یک خط را به‌صورت جداگانه.

آیا یک مقاله می‌تواند 0 درصد شباهت و 90 درصد امتیاز AI داشته باشد؟

بله، و این ترکیب یک اشکال نیست. این دو امتیاز به دو پرسش متفاوت پاسخ می‌دهند، بنابراین هر چهار ترکیبِ بالا و پایین ممکن است، و هر یک چیزی متفاوت دربارهٔ چگونگی تولید متن دلالت می‌کند.

  • شباهت پایین، امتیاز AI پایین: نوشتارِ اصیلِ معمولی که در عین حال با تنوعِ معمولِ انسانی نیز خوانده می‌شود. حالت رایج برای بیشتر کارهای واقعیِ دانشجویی.
  • شباهت پایین، امتیاز AI بالا: جمله‌های اصیل، نه کپی‌شده از هیچ‌جا، که از نظر آماری به‌صورت قابل‌پیش‌بینی خوانده می‌شوند، همان‌گونه که متنِ تولیدشده تمایل دارد. نشانهٔ نوشتارِ AI ویرایش‌نشده‌ای که هیچ‌کس آن را از یک منبعِ موجود بازنویسی نکرده است.
  • شباهت بالا، امتیاز AI پایین: متنی که با یک منبعِ موجودِ نوشته‌شده توسط انسان به‌طور نزدیک مطابقت دارد، بدون آن یکنواختیِ آماری که یک طبقه‌بند با تولید مرتبط می‌داند. متنِ کپی‌شده، که ابزارِ قدیمی‌تر آن را گرفته است نه ابزارِ جدیدتر.
  • شباهت بالا، امتیاز AI بالا: متنی که با یک منبعِ موجود مطابقت دارد و خودِ آن منبع نیز AI-تولیدشده بوده است، برای نمونه یک مقالهٔ پیش‌تر ارسال‌شدهٔ نوشته‌شده توسط AI یا صفحه‌ای از متنِ تولیدشده توسط AI که پیش‌تر از وبِ باز نمایه شده است.

هیچ‌یک از این ترکیب‌ها از نظر نرم‌افزاری امر غیرعادی‌ای را ایجاب نمی‌کند. این نتیجه از این واقعیت برمی‌آید که یک سامانه به‌دنبال تطابق می‌گردد و دیگری به‌دنبال الگو، و یک قطعه متن می‌تواند هر یک از این ویژگی‌ها را داشته باشد، هر دو را داشته باشد، یا هیچ‌یک را نداشته باشد.

آنچه یک امتیاز بالای AI انجام می‌دهد، و آنچه اثبات نمی‌کند

یک امتیاز بالای AI برآوردی آماری است، نه اعترافی که از متن استخراج شده باشد. این امتیاز می‌گوید نثرِ پیشِ روی طبقه‌بند، در انتخاب واژه‌ها و ریتم خود، به نوعی از نوشتار شباهت دارد که مدل برای نسبت دادن آن به تولید AI آموزش دیده است. این امتیاز یک جمله مشخص را به‌طور قطعی ماشین‌نوشته تشخیص نمی‌دهد، و درباره این‌که سند واقعاً چگونه تولید شده است نیز چیزی نمی‌داند، فقط می‌داند پس از تکمیل شدن چگونه خوانده می‌شود. TextPulse درباره اعداد خود نیز همین موضع را دارد: آنچه گزارش می‌کند یک Human Score برآوردی است که از متنِ پیشِ روی آن محاسبه شده است، نه حکمی درباره این‌که کدام ابزار، اگر اصلاً ابزاری بوده باشد، با سند تماس داشته است.

پاسخ عملی به هر یک از این دو عدد، چه یک similarity score پایین باشد و چه یک AI score بالا، یکسان است: باید آن را دلیلی برای بررسی دقیق‌تر دانست، نه یافته‌ای که بتوان آن را در نگاه نخست پذیرفت یا رد کرد. پیش‌نویس‌ها، یادداشت‌ها، و تاریخچه نسخه‌ها به شیوه‌ای که یک سند واقعاً نوشته شده است اشاره می‌کنند، به شکلی که هیچ درصدی، در هیچ‌یک از این دو گزارش، هرگز نمی‌تواند. هر کسی که کنجکاو باشد یک طبقه‌بند در پیش‌نویس خودش دقیقاً به چه چیزی واکنش نشان می‌دهد، می‌تواند همان الگوی واژه‌درسطح را با یک free perplexity checker برای خود ببیند، پیش از آن‌که هر گزارشی تولید شود.

مجموعه free tools collection در TextPulse سایر لایه‌های آماری را که پیش از آن‌که یک پیش‌نویس به دست مدرس برسد ارزش بررسی دارند، پوشش می‌دهد، نه فقط آن دو موردی را که در اینجا مقایسه شده‌اند.

پس از جدا شدن این دو عدد، پرسش بعدی این است که چه چیزی یک Turnitin score خوب به شمار می‌آید. برای detector دیگری که دانشجویان بیش از همه با آن روبه‌رو می‌شوند، GPTZero چگونه کار می‌کند در صفحه‌ای جداگانه توضیح داده شده است.

این دو عدد همچنان در همان گزارش کنار یکدیگر قرار خواهند داشت و افراد عجول همچنان آن‌ها را به‌صورت یک عدد واحد خواهند خواند. دانستن این‌که هر کدام در واقع به کدام پرسش پاسخ می‌دهد، چیزی است که یک جفت درصد گیج‌کننده را به دو بخش جداگانه و مفید از اطلاعات تبدیل می‌کند.

XLinkedInFacebook

سؤالات متداول

Turnitin similarity در برابر AI score به این برمی‌گردد که هر کدام چه چیزی را بررسی می‌کنند. similarity score گزارش می‌دهد چه مقدار از یک submission با متنی که از پیش در پایگاه داده Turnitin از صفحات وب، publications و past student papers وجود دارد، مطابقت دارد. AI score یک سنجش جداگانه و مستقل است که برآورد می‌کند نثر تا چه اندازه machine-generated به نظر می‌رسد، بدون هیچ ارجاعی به هیچ پایگاه داده‌ای. مستندات خود Turnitin بیان می‌کند که این دو عدد بر یکدیگر اثر نمی‌گذارند.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

از تازه‌های انسان‌سازی AI باخبر بمانید

نکات مربوط به نگارش دانشگاهی، تشخیص AI و انسان‌سازی را در صندوق ورودی‌تان دریافت کنید.

بدون اسپم. هر زمان خواستید لغو اشتراک کنید.