AI Detection

پریپلکسی در تشخیص AI چیست؟

پریپلکسی عددی است که یک مدل زبانی برای توصیف میزان شگفت‌زدگی خود از انتخاب واژه‌های شما تولید می‌کند. این نوشته این سنجه را به خاستگاه 1977 آن بازمی‌گرداند، فرمول را بررسی می‌کند، و توضیح می‌دهد چرا یک متن یکسان بسته به این که کدام مدل آن را می‌خواند، می‌تواند امتیاز متفاوتی بگیرد.

6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

برای perplexity و تشخیص AI به‌صورت هم‌زمان جست‌وجو کنید، و چند نتیجهٔ برتر در نهایت دربارهٔ یک محصول نامرتبط هستند: یک موتور جست‌وجوی مبتنی بر AI که اتفاقاً Perplexity نام دارد. معیاری که یک detector واقعاً گزارش می‌کند، جز واژهٔ آن، هیچ شباهتی با آن شرکت ندارد. این معیار از پژوهش‌های تشخیص گفتار، دهه‌ها قدیمی‌تر از GPTZero یا موتور جست‌وجو، آمده است و چیزی محدودتر از هر دو را می‌سنجد: این‌که یک language model تا چه اندازه از واژه‌هایی که از پیش روی صفحه هستند شگفت‌زده می‌شود.

پس perplexity در AI detection چیست؟ Perplexity یک نمره است که توضیح می‌دهد یک language model تا چه اندازه واژه‌های دقیق یک passage را پیش‌بینی کرده است، و با میانگین‌گیری از احتمال‌های خود model و تبدیل نتیجه به یک عدد واحد به دست می‌آید. نمرهٔ پایین یعنی model همچنان درست حدس می‌زد. نمرهٔ بالا یعنی مدام غافلگیر می‌شد.

این ایده از هر AI detector موجود در بازار قدیمی‌تر است، و به‌تنهایی هیچ چیز دربارهٔ این‌که چه کسی یک document را نوشته است نمی‌گوید. وقتی حساب‌وکتاب پشت این عدد دیده شود، یک نمره در یک report دیگر شبیه یک حکم به نظر نمی‌رسد و بیشتر شبیه چیزی می‌شود که واقعاً هست: توصیفی از انتخاب واژه.

perplexity در AI detection چیست؟

Perplexity یک سنجش است که از language modeling وام گرفته شده است. این سنجش نشان می‌دهد یک model تا چه اندازه واژه‌های مشخصی را که در یک passage آمده‌اند پیش‌بینی کرده است و آن را به صورت یک عدد واحد گزارش می‌کند. detectorها همین سنجش را بر یک document ارسالی اعمال می‌کنند: عدد پایین، یعنی حدس‌های model به‌طور نزدیک با واژه‌های واقعی منطبق بوده‌اند، به‌عنوان نشانهٔ authorship ماشینی خوانده می‌شود، و عدد بالا به‌عنوان نشانهٔ authorship انسانی خوانده می‌شود. هیچ بخشی از این محاسبه استدلال document، citationهای آن، یا موضوع آن را نمی‌خواند. فقط این را می‌خواند که هر واژه تا چه اندازه قابل انتظار بوده است، یکی‌یکی.

detectorها این سنجش را اختراع نکردند. آن‌ها ابزاری را وام گرفتند که سامانه‌های speech recognition و machine translation از دهه‌ها پیش برای سنجش این‌که یک model تا چه اندازه زبان معمولی را پیش‌بینی کرده است به کار می‌بردند، و آن را به‌عنوان جانشینی برای authorship بازکاربرد کردند، کاری که در اصل هرگز برای آن ساخته نشده بود.

هیچ‌یک از این‌ها هیچ ارتباطی با موتور جست‌وجوی نامرتبطی که پیش‌تر ذکر شد ندارد. perplexity که یک آشکارساز گزارش می‌کند هرگز یک شرکت نیست و هرگز با حرف بزرگ نوشته نمی‌شود: این فقط یک ویژگی آماری ساده از یک دنباله واژه‌هاست که تازه و بر اساس هر متنی که به آن داده شود محاسبه می‌شود.

perplexity در عمل چگونه محاسبه می‌شود

این محاسبه به زمانی بسیار پیش‌تر از هر محصول AI بازمی‌گردد. Frederick Jelinek، Robert Mercer، Lalit Bahl و James Baker در 1977 perplexity را معرفی کردند تا نشان دهند یک وظیفه تشخیص گفتار برای یک مدل آماری تا چه اندازه دشوار است، دهه‌ها پیش از آنکه کسی این اصطلاح را برای یک مقاله یا یک گزارش آزمایشگاهی به کار ببرد. تعریف آن از آن زمان تاکنون تغییر نکرده است.

در هر موقعیت در یک سند، مدل برای واژه‌ای که واقعاً در ادامه می‌آید یک احتمال خروجی می‌دهد، چیزی مانند 0.72 برای یک گذار رایج یا 0.03 برای یک گذار غیرمعمول. perplexity لگاریتم این احتمال‌ها را در سراسر کل متن میانگین می‌گیرد، سپس این میانگین را با یک توان معکوس می‌کند.

توان در اینجا بیش از آنچه به نظر می‌رسد کار انجام می‌دهد. میانگین‌گیری از احتمال‌های لگاریتمی دقیقاً همان کاری است که هنگام محاسبه cross-entropy انجام می‌دهیم، و این همان شیوه نظریه اطلاعات برای بیان این است که برای رمزگذاری یک دنباله با توجه به پیش‌بینی‌های یک مدل به چند بیت نیاز دارید. اما perplexity شمارش بیت‌ها را به چیزی برمی‌گرداند که بهتر می‌توانیم بفهمیم, یک تعداد مؤثر از انتخاب‌ها، نه یک شمارش انتزاعی از بیت‌ها.

آنچه از آن محاسبه باقی می‌ماند، خوانشی روشن و تقریباً فیزیکی دارد. مدلی که هر بار کاملاً مطمئن است، perplexity برابر 1 تولید می‌کند، یعنی کف این مقیاس. مدلی که هر موقعیت را یک انتخاب برابر میان eighty واژه هم‌احتمال در نظر می‌گیرد، perplexity برابر 80 تولید می‌کند.

بیشتر اسناد واقعی جایی میان این دو حد قرار می‌گیرند، و این که دقیقاً کجا قرار می‌گیرند به نویسنده، موضوع، و این که کدام مدل در حال خواندن است بستگی دارد.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

چرا نوشتار انسانی معمولاً امتیاز متفاوتی می‌گیرد

انتظارات یک مدل کاملاً از آنچه پیش از آن آمده است، یک واژه در هر بار، ساخته می‌شود. پس از عبارت 'the treatment group showed a statistically', اکثریت قاطع ادامه‌های خوش‌ساخت 'significant' هستند، و مدلی که بر حجم زیادی از نوشتار علمی آموزش دیده است، بدون تردید به آن واژه احتمال بالایی اختصاص می‌دهد. یک نویسنده انسانی که به همان عبارت می‌رسد، ممکن است او نیز به 'significant' برسد، زیرا خودِ این عبارت جزئی ثابت از این ژانر است. شکاف در جای دیگری پدیدار می‌شود, در اسمی که دو جمله بعد انتخاب می‌شود، در توضیحی که در پرانتز افزوده می‌شود، در عددی که به جای یک مقدار گرد، تا یک رقم اعشار نامعمول گزارش می‌شود.

هیچ‌یک از این‌ها ترفند نیست. وقتی کسی که درباره داده‌های واقعی می‌نویسد می‌کوشد به عدد دقیق، قید دقیق، یا واژه اندکی محدودتر دست یابد، در واقع به چیزهایی دست می‌برد که درباره خودِ کار صادق‌اند، نه درباره ژانر. و هر یک از این انتخاب‌ها برای مدل اندکی شگفتی بیشتر هزینه دارد. شگفتی همان چیزی است که این امتیاز برای جمع کردن آن ساخته شده است.

استنتاج بیش از آنچه اندازه‌گیری بتواند پشتیبانی کند، کار انجام می‌دهد. Perplexity پیش‌بینی‌پذیری را به طور مستقیم اندازه می‌گیرد. این مفهوم تنها با این فرض که نوشتار قابل پیش‌بینی در میان انسان‌ها نادر و در میان مدل‌ها رایج است، نویسندگی را استنتاج می‌کند، فرضی که معمولاً معقول است و گاهی به شکلی مشخص و قابل شناسایی نادرست از آب درمی‌آید، زیرا پیش‌بینی‌پذیری ویژگی‌ای است که متن می‌تواند به دلایلی داشته باشد که هیچ ربطی به این ندارد چه کسی آن را تایپ کرده است.

چرا یک قطعه یکسان می‌تواند امتیازهای متفاوتی بگیرد

این امتیاز همچنین از آنچه به نظر می‌رسد کم‌قابل‌انتقال‌تر است، زیرا هرگز در خلأ اندازه‌گیری نمی‌شود. Perplexity همیشه در برابر آموزش یک مدل مرجع مشخص محاسبه می‌شود، و این وابستگی مسائلی ایجاد می‌کند که هیچ تعریف واحدی به تنهایی نمی‌تواند نشان دهد.

عاملچه چیزی تغییر می‌کندچرا این اتفاق می‌افتد
اینکه کدام مدل در حال خواندن استیک پاراگراف یکسان می‌تواند روی یک مدل امتیاز پایین و روی مدل دیگر امتیاز بالا بگیردPerplexity فقط همیشه نسبت به داده‌های آموزشی یک مدل سنجیده می‌شود، و مدل‌های مختلف بر روی متن‌های متفاوتی آموزش دیده‌اند
اینکه آیا آن بخش متنِ بازتولیدشده و رایج استیک سند تاریخی مشهور یا یک تعریف کتاب درسی می‌تواند حتی وقتی یک نفر همه واژه‌های آن را در آشکارساز تایپ کرده باشد، امتیاز perplexity پایین بگیردPangram Labs به اعلامیه استقلال به عنوان یک نمونه اشاره می‌کند, این متن آن‌قدر در داده‌های آموزشی نقل شده است که یک مدل هر جمله آن را بدیهی می‌یابد
اینکه آیا آشکارساز اصلا می‌تواند احتمال‌های توکن را ببیندمدل‌های تجاری بسته مانند ChatGPT، Gemini و Claude احتمال‌های هر واژه را که perplexity به آن نیاز دارد، آشکار نمی‌کنندآشکارسازها به جای محاسبه perplexity نسبت به مدلی که واقعا متن را تولید کرده است، امتیاز را با یک مدل بازِ جایگزین تقریب می‌زنند

هیچ‌یک از این‌ها عدد را بی‌معنا نمی‌کند، فقط اعتماد کردن به آن را به عنوان یک داوری مستقل پرخطرتر می‌سازد. مستندات خود GPTZero زمانی یک قاعده سرانگشتی تقریبی منتشر کرده بود که perplexity بالاتر از 85 را بیشتر به نفع انسانی بودن می‌خواند، اما آستانه یک فروشنده بر روی یک مدل به ابزار دیگری که بر روی مدل متفاوتی سنجیده شده است منتقل نمی‌شود. آشکارسازی که یک امتیاز واحد گزارش می‌کند، همه عوامل بالا را در یک عدد فشرده می‌کند، بی‌آنکه بگوید کدام‌یک این کار را انجام داده‌اند.

یک امتیاز perplexity در عمل دقیقا چه چیزی را به شما می‌گوید

آشکارسازهای تجاری perplexity را همراه با الگوهای سطح جمله، آموزش طبقه‌بند و چند سیگنال دیگر در هم می‌آمیزند، پیش از آنکه اصلا یک عدد واحد را در گزارش چاپ کنند. تصویر کامل‌ترِ اینکه آشکارسازهای AI در عمل چگونه کار می‌کنند جداگانه بررسی شده است، و توضیح می‌دهد بقیه این عدد از کجا می‌آید.

ریتم جمله به جمله، یک سیگنال مرتبط اما جداگانه است که به طور مستقل توسط burstiness checker بررسی می‌شود، و به میزان تنوع در سراسر یک متن می‌پردازد، نه به یک واژه منفرد.

هیچ یک از این اعداد نمی‌تواند ثابت کند چه کسی یک سند را نوشته است، از جمله Human Score برآوردی که TextPulse از یک پیش‌نویس ارسال‌شده محاسبه می‌کند، که متن را توصیف می‌کند، نه این که درباره آن حکم صادر کند. نسخه ساده‌شده همین ایده، یعنی تنوع واژگانی به جای احتمال کامل مدل، نیروی محرک free perplexity checker در این سایت است، و ارزش دارد آن را در برابر پاراگرافی که منشأ آن از پیش معلوم است امتحان کنید، پیش از آن که به آنچه یک گزارش درباره نوشته شخص دیگری می‌گوید اعتماد کنید.

perplexity checker در کنار سایر free tools TextPulse قرار دارد، بنابراین بررسی کامل یک پیش‌نویس، واژگان، ریتم و همه چیزهای دیگر، نیازی به باز بودن همزمان دوازده زبانه جداگانه ندارد.

perplexity یکی از دو آماری است که این سامانه‌ها بر آن تکیه می‌کنند. دیگری burstiness، یعنی تغییرپذیری در طول و ساختار جمله در سراسر یک متن است، و زیر هر دو، محاسبات احتمال توکن قرار دارد که در وهله نخست این امتیاز را تولید می‌کند.

یک عدد در یک گزارش، پایان یک زنجیره طولانی از محاسبات است، نه آغاز یک بحث درباره این که چه کسی چیزی را نوشته است. پرسش جالب‌تر، وقتی محاسبات دیگر رازآلود نیستند، این است که دقیقاً چه چیزی یک سند را در وهله نخست شگفت‌انگیز یا قابل پیش‌بینی کرده است، و این پرسشی درباره خودِ نوشتار است.

Frequently Asked Questions

خیر. پریپلکسی در تشخیص AI یک سنجش آماری چنددهه‌ای از مدل‌سازی زبان است که نشان می‌دهد یک متن تا چه اندازه برای یک مدل قابل پیش‌بینی است. Perplexity AI یک شرکت نامرتبط است که یک محصول جست‌وجوی مبتنی بر AI می‌سازد. این دو فقط نامی مشترک دارند و هیچ چیز دیگری ندارند، و اشتباه گرفتن آن‌ها به فهم گزارش یک آشکارساز کمکی نمی‌کند.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

پریپلکسی در تشخیص AI چیست؟ | TextPulse.ai