Turnitin Similarity Score در برابر AI Score: دو گزارش متفاوت
یک similarity score و یک AI score به پرسشهای متفاوتی پاسخ میدهند، بنابراین یک مقاله میتواند در یکی امتیاز پایین و در دیگری امتیاز بالا بگیرد، بیآنکه هیچیک از این دو عدد نادرست باشد. هر کدام چه چیزی را میسنجند، چه چیزی آن را فعال میکند، و یک عدد بالا چه چیزی را ثابت میکند و چه چیزی را ثابت نمیکند.
یک گزارش با دو عدد روی آن میرسد: یک امتیاز شباهت 3 percent و یک امتیاز AI برابر 88 percent. برداشت طبیعی این است که باید در حال اندازهگیری یک چیز باشند، پس عدد پایین باید یعنی عدد بالا هم احتمالاً نادرست است. اما اینگونه کار نمیکند. Turnitin similarity vs AI score مقایسهای میان دو سامانه جداگانه است که دو چیز جداگانه را بررسی میکنند، و یک ارسال میتواند در یکی امتیاز پایین و در دیگری امتیاز بالا بگیرد، بیآنکه هیچیک از این دو عدد خطا باشد.
این سامانه از AI قدیمیتر است و برای شناسایی متنی ساخته شده که با چیزی از پیش موجود تطابق دارد. آن یکی جدیدتر است و به همان Similarity Report افزوده شده، اما بهعنوان یک سنجش مستقلِ خودش، و برای برآورد اینکه آیا نثر شبیه متن تولیدشده توسط ماشین است یا نه، صرفنظر از اینکه اصلاً با چیزی تطابق داشته باشد یا نه. طبق مستندات خود Turnitin، این دو کاملاً مستقلاند و بر یکدیگر اثر نمیگذارند. هر چیز دیگر در این بخش.
Turnitin Similarity vs AI Score: هر عدد چه چیزی را گزارش میکند
Turnitin این دو را بهعنوان دو سنجش متفاوت در یک محصول واحد در نظر میگیرد، نه دو نمای متفاوت از یک نتیجه. Similarity Report یک ارسال را با پایگاه دادهای از محتوای وب، انتشارات دانشگاهی، و مقالههای دانشجویی که پیشتر ارسال شدهاند مقایسه میکند، و درصدی از متن ارسال را که با چیزی از پیش در آن پایگاه داده مطابقت دارد بازمیگرداند. تشخیص نگارش AI از مدلی کاملاً متفاوت استفاده میکند که به همان گزارش افزوده شده است و امتیاز مستقل خودش را دارد، مدلی که برای داوری اینکه نثر یک بخش تا چه اندازه به نگارش تولیدشده توسط ماشین شباهت دارد آموزش دیده است، بدون هیچ ارجاعی به هیچ پایگاه داده بیرونی. سازوکار کاملتر اینکه طبقهبند AI در Turnitin چگونه به آن عدد میرسد جداگانه توضیح داده شده است؛ آنچه در اینجا اهمیت دارد این است که این سامانه به پرسشی متفاوت از موتور شباهت که در همان گزارش قرار دارد پاسخ میدهد.
امتیاز شباهت دقیقاً چه چیزی را اندازه میگیرد
شباهت، یک تمرین تطبیق است، نه یک داوری. راهنمای خود Turnitin صریح است که این ابزار، سرقت ادبی را بررسی نمیکند. این ابزار همپوشانی را بررسی میکند و تفسیر را به مدرس یا استادی که گزارش را میخواند واگذار میکند. نقلقولی که درست از متن جدا شده باشد، عبارتی در بخش روشها که در سراسر یک زیررشته مشترک است، فهرست منابعی که همانطور قالببندی شده که هر مقاله در مجله فهرست منابع خود را قالببندی میکند، همه اینها میتوانند بهعنوان تطابق ثبت شوند، زیرا سامانه رشتههای همپوشان متن را میشمارد، نه اینکه داوری کند آیا این همپوشانی مشروع است یا نه.
به همین دلیل است که نمره شباهت صفر، کمتر از آنچه به نظر میرسد، اثبات میکند. این یعنی در متن ارسالی هیچ بخش بلند و پیوستهای از متن که در منابع نمایهشده Turnitin در جای دیگری یافت شود، وجود ندارد. این نمره هیچ چیز درباره این نمیگوید که جملههای موجود چگونه تولید شدهاند، زیرا تولید جملهای که با هیچ چیز در یک پایگاه داده تطابق نداشته باشد، همان مهارت تولید جملهای نیست که یک مدل زبانی آن را پیشبینی نمیکرد.
مقاله خود را انسانیسازی کنید
متنِ کمکگرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژههای مهم یا ارجاعها.
نمره AI در واقع چه چیزی را میسنجد
نمره AI هیچ پایگاه دادهای برای مقایسه ندارد. یک طبقهبند، نثر ارسالی را میخواند و بر پایه الگوهایی که از نمونههای نوشتار انسانی و تولیدشده توسط AI آموخته است، برآورد میکند که این نثر تا چه اندازه احتمال دارد از یک مدل آمده باشد نه از یک انسان. هیچ بخشی از این برآورد به این وابسته نیست که آیا همان جمله دقیق پیشتر در جایی ظاهر شده است یا نه. یک جمله میتواند کاملاً یگانه باشد، تا پیش از این ارسال، هیچکس آن را تایپ نکرده باشد، و با این حال اگر انتخاب واژهها و ریتم آن از الگویی پیروی کند که یک مدل زبانی معمولاً تولید میکند، همچنان از نظر آماری شبیه خروجی AI خوانده شود.
این همان قلمرو آماری است که در شرح گستردهترِ how AI detectors actually work بهطور کامل پوشش داده میشود: پیشبینیپذیری در سطح واژه و ریتم در سطح جمله، که در یک نمره سندی واحد ادغام شدهاند. نسخه Turnitin از آن طبقهبند اختصاصی است، اما فرض بنیادین آن، یعنی اینکه متن تولیدشده معمولاً از نظر آماری متعارفتر از نوشتار انسانی است، همان فرضی است که در پسِ هر ابزار این دسته قرار دارد.
| امتیاز شباهت | امتیاز AI | |
|---|---|---|
| آنچه میسنجد | اینکه چه مقدار از متنِ ارسالشده با سایر اسناد نمایهشده مطابقت دارد | اینکه نثر تا چه اندازه به نوشتارِ معمولاً آماریِ تولیدشده توسط AI شباهت دارد |
| آنچه یک عدد بالا را فعال میکند | نقلقولهای طولانی، عبارتپردازیهای رایجِ خاصِ حوزه، مطالبِ بازاستفادهشده، یا تطابق با یک ارسالِ پیشین | ریتم یکنواختِ جملهها و انتخابهای واژگانیِ بهطور پیوسته قابلپیشبینی در سراسر سند |
| آنچه یک عدد بالا ثابت نمیکند | اینکه متنِ مطابقشده بهطور نادرست استفاده شده است. مطالبی که بهدرستی ارجاع داده شدهاند نیز همچنان میتوانند بهصورت یک تطابق ثبت شوند. | اینکه هر جملهٔ منفردی توسط AI تولید شده است. این طبقهبند الگوی کلی سند را میخواند، نه یک خط را بهصورت جداگانه. |
آیا یک مقاله میتواند 0 درصد شباهت و 90 درصد امتیاز AI داشته باشد؟
بله، و این ترکیب یک اشکال نیست. این دو امتیاز به پرسشهای متفاوتی پاسخ میدهند، بنابراین هر چهار ترکیبِ بالا و پایین ممکن است، و هر کدام چیزی متفاوت دربارهٔ شیوهٔ تولید متن دلالت میکند.
- شباهت پایین، امتیاز AI پایین: نوشتارِ اصیلِ معمولی که در عین حال با تنوعِ معمولِ انسانی نیز خوانده میشود. حالت رایج برای بیشتر کارهای واقعیِ دانشجویی.
- شباهت پایین، امتیاز AI بالا: جملههای اصیل، نه کپیشده از جایی، که از نظر آماری بهصورت قابلپیشبینی خوانده میشوند، همانگونه که متنِ تولیدشده معمولاً چنین است. نشانهٔ نوشتارِ AI ویرایشنشدهای که هیچکس آن را از یک منبع موجود بازنویسی نکرده است.
- شباهت بالا، امتیاز AI پایین: متنی که بهطور نزدیک با یک منبعِ موجودِ نوشتهشده توسط انسان مطابقت دارد، بدون آن یکنواختیِ آماری که یک طبقهبند آن را با تولید متن مرتبط میداند. متنِ کپیشده، که بهجای ابزار جدیدتر، توسط ابزار قدیمیتر شناسایی شده است.
- شباهت بالا، امتیاز AI بالا: متنی که با یک منبعِ موجود مطابقت دارد و خودِ آن منبع نیز توسط AI تولید شده بود، برای نمونه یک مقالهٔ پیشتر ارسالشدهٔ نوشتهشده توسط AI یا صفحهای از متنِ تولیدشده توسط AI که پیشتر از وبِ باز نمایه شده است.
هیچیک از این ترکیبها از نظر نرمافزاری مستلزم امر غیرعادی نیست. این نتیجه از این واقعیت به دست میآید که یک سامانه بهدنبال تطابق میگردد و دیگری بهدنبال الگو، و یک قطعه متن میتواند هر یک از این ویژگیها را داشته باشد، هر دو را داشته باشد، یا هیچیک را نداشته باشد.
یک امتیاز بالای AI چه چیزی را اثبات میکند، و چه چیزی را اثبات نمیکند
یک امتیاز بالای AI یک برآورد آماری است، نه اعترافی که از متن استخراج شده باشد. این امتیاز میگوید نثرِ پیشِ روی طبقهبند، در انتخاب واژهها و ریتم خود، شبیه نوع نوشتاری است که مدل برای مرتبط دانستن با تولید AI بر آن آموزش دیده است. این امتیاز یک جمله مشخص را بهطور قطعی ماشینیشده شناسایی نمیکند، و درباره اینکه سند واقعاً چگونه تولید شده است نیز چیزی نمیداند، بلکه فقط میداند پس از تکمیلشدن چگونه خوانده میشود. TextPulse نیز درباره اعداد خود همین موضع را دارد: آنچه گزارش میکند یک Human Score برآوردی است که از متنِ پیشِ روی آن محاسبه شده است، نه حکمی درباره اینکه کدام ابزار، اگر اصلاً ابزاری بوده باشد، به سند دست زده است.
پاسخ عملی به هر یک از این دو عدد، چه یک امتیاز شباهت پایین باشد و چه یک امتیاز بالای AI، یکسان است: باید آن را دلیلی برای بررسی دقیقتر دانست، نه یافتهای که بتوان آن را در نگاه اول پذیرفت یا رد کرد. پیشنویسها، یادداشتها، و تاریخچه نسخهها به شیوهای که هیچ درصدی، در هیچیک از این دو گزارش، هرگز نمیتواند، نشان میدهند که یک سند واقعاً چگونه نوشته شده است. هر کسی که کنجکاو باشد بداند یک طبقهبند در پیشنویس خودش دقیقاً به چه چیزی واکنش نشان میدهد، میتواند همان الگوی واژهبهواژه را با یک free perplexity checker، بسیار پیش از آنکه هر گزارشی تولید شود، خود ببیند.
مجموعه free tools collection در TextPulse سایر لایههای آماری را که پیش از آنکه یک پیشنویس به دست مدرس برسد ارزش بررسی دارند، پوشش میدهد، نه فقط آن دو موردی را که در اینجا مقایسه شدهاند.
پس از جدا شدن این دو عدد، پرسش بعدی این است که چه چیزی یک امتیاز خوب Turnitin را تشکیل میدهد. برای آشکارساز دیگری که دانشجویان بیش از همه با آن روبهرو میشوند، GPTZero چگونه کار میکند در صفحهای جداگانه توضیح داده شده است.
این دو عدد همچنان در همان گزارش کنار یکدیگر قرار خواهند داشت و افراد عجول همچنان آنها را بهصورت یک عدد واحد خواهند خواند. دانستن اینکه هر کدام در واقع به کدام پرسش پاسخ میدهد، چیزی است که یک جفت درصد گیجکننده را به دو بخش جداگانه و مفید از اطلاعات تبدیل میکند.
سؤالات متداول
Turnitin similarity در برابر AI score به این برمیگردد که هر کدام چه چیزی را بررسی میکنند. similarity score نشان میدهد چه مقدار از یک submission با متنی که از پیش در پایگاه داده Turnitin از صفحات وب، publications و past student papers وجود دارد، مطابقت دارد. AI score یک سنجش جداگانه و مستقل است که برآورد میکند نثر تا چه اندازه machine-generated به نظر میرسد، و اصلا به هیچ پایگاه دادهای ارجاع نمیدهد. مستندات خود Turnitin تصریح میکند که این دو عدد بر یکدیگر اثر نمیگذارند.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.