پریپلکسی در تشخیص AI چیست؟
پریپلکسی عددی است که یک مدل زبانی برای توصیف میزان شگفتزدگی خود از انتخاب واژههای شما تولید میکند. این نوشته این سنجه را به خاستگاه 1977 آن بازمیگرداند، فرمول را بررسی میکند، و توضیح میدهد چرا یک متن یکسان بسته به این که کدام مدل آن را میخواند، میتواند امتیاز متفاوتی بگیرد.
برای perplexity و تشخیص AI بهصورت همزمان جستوجو کنید، و چند نتیجهٔ برتر در نهایت دربارهٔ یک محصول نامرتبط هستند: یک موتور جستوجوی مبتنی بر AI که اتفاقاً Perplexity نام دارد. معیاری که یک detector واقعاً گزارش میکند، جز واژهٔ آن، هیچ شباهتی با آن شرکت ندارد. این معیار از پژوهشهای تشخیص گفتار، دههها قدیمیتر از GPTZero یا موتور جستوجو، آمده است و چیزی محدودتر از هر دو را میسنجد: اینکه یک language model تا چه اندازه از واژههایی که از پیش روی صفحه هستند شگفتزده میشود.
پس perplexity در AI detection چیست؟ Perplexity یک نمره است که توضیح میدهد یک language model تا چه اندازه واژههای دقیق یک passage را پیشبینی کرده است، و با میانگینگیری از احتمالهای خود model و تبدیل نتیجه به یک عدد واحد به دست میآید. نمرهٔ پایین یعنی model همچنان درست حدس میزد. نمرهٔ بالا یعنی مدام غافلگیر میشد.
این ایده از هر AI detector موجود در بازار قدیمیتر است، و بهتنهایی هیچ چیز دربارهٔ اینکه چه کسی یک document را نوشته است نمیگوید. وقتی حسابوکتاب پشت این عدد دیده شود، یک نمره در یک report دیگر شبیه یک حکم به نظر نمیرسد و بیشتر شبیه چیزی میشود که واقعاً هست: توصیفی از انتخاب واژه.
perplexity در AI detection چیست؟
Perplexity یک سنجش است که از language modeling وام گرفته شده است. این سنجش نشان میدهد یک model تا چه اندازه واژههای مشخصی را که در یک passage آمدهاند پیشبینی کرده است و آن را به صورت یک عدد واحد گزارش میکند. detectorها همین سنجش را بر یک document ارسالی اعمال میکنند: عدد پایین، یعنی حدسهای model بهطور نزدیک با واژههای واقعی منطبق بودهاند، بهعنوان نشانهٔ authorship ماشینی خوانده میشود، و عدد بالا بهعنوان نشانهٔ authorship انسانی خوانده میشود. هیچ بخشی از این محاسبه استدلال document، citationهای آن، یا موضوع آن را نمیخواند. فقط این را میخواند که هر واژه تا چه اندازه قابل انتظار بوده است، یکییکی.
detectorها این سنجش را اختراع نکردند. آنها ابزاری را وام گرفتند که سامانههای speech recognition و machine translation از دههها پیش برای سنجش اینکه یک model تا چه اندازه زبان معمولی را پیشبینی کرده است به کار میبردند، و آن را بهعنوان جانشینی برای authorship بازکاربرد کردند، کاری که در اصل هرگز برای آن ساخته نشده بود.
هیچیک از اینها هیچ ارتباطی با موتور جستوجوی نامرتبطی که پیشتر ذکر شد ندارد. perplexity که یک آشکارساز گزارش میکند هرگز یک شرکت نیست و هرگز با حرف بزرگ نوشته نمیشود: این فقط یک ویژگی آماری ساده از یک دنباله واژههاست که تازه و بر اساس هر متنی که به آن داده شود محاسبه میشود.
perplexity در عمل چگونه محاسبه میشود
این محاسبه به زمانی بسیار پیشتر از هر محصول AI بازمیگردد. Frederick Jelinek، Robert Mercer، Lalit Bahl و James Baker در 1977 perplexity را معرفی کردند تا نشان دهند یک وظیفه تشخیص گفتار برای یک مدل آماری تا چه اندازه دشوار است، دههها پیش از آنکه کسی این اصطلاح را برای یک مقاله یا یک گزارش آزمایشگاهی به کار ببرد. تعریف آن از آن زمان تاکنون تغییر نکرده است.
در هر موقعیت در یک سند، مدل برای واژهای که واقعاً در ادامه میآید یک احتمال خروجی میدهد، چیزی مانند 0.72 برای یک گذار رایج یا 0.03 برای یک گذار غیرمعمول. perplexity لگاریتم این احتمالها را در سراسر کل متن میانگین میگیرد، سپس این میانگین را با یک توان معکوس میکند.
توان در اینجا بیش از آنچه به نظر میرسد کار انجام میدهد. میانگینگیری از احتمالهای لگاریتمی دقیقاً همان کاری است که هنگام محاسبه cross-entropy انجام میدهیم، و این همان شیوه نظریه اطلاعات برای بیان این است که برای رمزگذاری یک دنباله با توجه به پیشبینیهای یک مدل به چند بیت نیاز دارید. اما perplexity شمارش بیتها را به چیزی برمیگرداند که بهتر میتوانیم بفهمیم, یک تعداد مؤثر از انتخابها، نه یک شمارش انتزاعی از بیتها.
آنچه از آن محاسبه باقی میماند، خوانشی روشن و تقریباً فیزیکی دارد. مدلی که هر بار کاملاً مطمئن است، perplexity برابر 1 تولید میکند، یعنی کف این مقیاس. مدلی که هر موقعیت را یک انتخاب برابر میان eighty واژه هماحتمال در نظر میگیرد، perplexity برابر 80 تولید میکند.
بیشتر اسناد واقعی جایی میان این دو حد قرار میگیرند، و این که دقیقاً کجا قرار میگیرند به نویسنده، موضوع، و این که کدام مدل در حال خواندن است بستگی دارد.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
چرا نوشتار انسانی معمولاً امتیاز متفاوتی میگیرد
انتظارات یک مدل کاملاً از آنچه پیش از آن آمده است، یک واژه در هر بار، ساخته میشود. پس از عبارت 'the treatment group showed a statistically', اکثریت قاطع ادامههای خوشساخت 'significant' هستند، و مدلی که بر حجم زیادی از نوشتار علمی آموزش دیده است، بدون تردید به آن واژه احتمال بالایی اختصاص میدهد. یک نویسنده انسانی که به همان عبارت میرسد، ممکن است او نیز به 'significant' برسد، زیرا خودِ این عبارت جزئی ثابت از این ژانر است. شکاف در جای دیگری پدیدار میشود, در اسمی که دو جمله بعد انتخاب میشود، در توضیحی که در پرانتز افزوده میشود، در عددی که به جای یک مقدار گرد، تا یک رقم اعشار نامعمول گزارش میشود.
هیچیک از اینها ترفند نیست. وقتی کسی که درباره دادههای واقعی مینویسد میکوشد به عدد دقیق، قید دقیق، یا واژه اندکی محدودتر دست یابد، در واقع به چیزهایی دست میبرد که درباره خودِ کار صادقاند، نه درباره ژانر. و هر یک از این انتخابها برای مدل اندکی شگفتی بیشتر هزینه دارد. شگفتی همان چیزی است که این امتیاز برای جمع کردن آن ساخته شده است.
استنتاج بیش از آنچه اندازهگیری بتواند پشتیبانی کند، کار انجام میدهد. Perplexity پیشبینیپذیری را به طور مستقیم اندازه میگیرد. این مفهوم تنها با این فرض که نوشتار قابل پیشبینی در میان انسانها نادر و در میان مدلها رایج است، نویسندگی را استنتاج میکند، فرضی که معمولاً معقول است و گاهی به شکلی مشخص و قابل شناسایی نادرست از آب درمیآید، زیرا پیشبینیپذیری ویژگیای است که متن میتواند به دلایلی داشته باشد که هیچ ربطی به این ندارد چه کسی آن را تایپ کرده است.
چرا یک قطعه یکسان میتواند امتیازهای متفاوتی بگیرد
این امتیاز همچنین از آنچه به نظر میرسد کمقابلانتقالتر است، زیرا هرگز در خلأ اندازهگیری نمیشود. Perplexity همیشه در برابر آموزش یک مدل مرجع مشخص محاسبه میشود، و این وابستگی مسائلی ایجاد میکند که هیچ تعریف واحدی به تنهایی نمیتواند نشان دهد.
| عامل | چه چیزی تغییر میکند | چرا این اتفاق میافتد |
|---|---|---|
| اینکه کدام مدل در حال خواندن است | یک پاراگراف یکسان میتواند روی یک مدل امتیاز پایین و روی مدل دیگر امتیاز بالا بگیرد | Perplexity فقط همیشه نسبت به دادههای آموزشی یک مدل سنجیده میشود، و مدلهای مختلف بر روی متنهای متفاوتی آموزش دیدهاند |
| اینکه آیا آن بخش متنِ بازتولیدشده و رایج است | یک سند تاریخی مشهور یا یک تعریف کتاب درسی میتواند حتی وقتی یک نفر همه واژههای آن را در آشکارساز تایپ کرده باشد، امتیاز perplexity پایین بگیرد | Pangram Labs به اعلامیه استقلال به عنوان یک نمونه اشاره میکند, این متن آنقدر در دادههای آموزشی نقل شده است که یک مدل هر جمله آن را بدیهی مییابد |
| اینکه آیا آشکارساز اصلا میتواند احتمالهای توکن را ببیند | مدلهای تجاری بسته مانند ChatGPT، Gemini و Claude احتمالهای هر واژه را که perplexity به آن نیاز دارد، آشکار نمیکنند | آشکارسازها به جای محاسبه perplexity نسبت به مدلی که واقعا متن را تولید کرده است، امتیاز را با یک مدل بازِ جایگزین تقریب میزنند |
هیچیک از اینها عدد را بیمعنا نمیکند، فقط اعتماد کردن به آن را به عنوان یک داوری مستقل پرخطرتر میسازد. مستندات خود GPTZero زمانی یک قاعده سرانگشتی تقریبی منتشر کرده بود که perplexity بالاتر از 85 را بیشتر به نفع انسانی بودن میخواند، اما آستانه یک فروشنده بر روی یک مدل به ابزار دیگری که بر روی مدل متفاوتی سنجیده شده است منتقل نمیشود. آشکارسازی که یک امتیاز واحد گزارش میکند، همه عوامل بالا را در یک عدد فشرده میکند، بیآنکه بگوید کدامیک این کار را انجام دادهاند.
یک امتیاز perplexity در عمل دقیقا چه چیزی را به شما میگوید
آشکارسازهای تجاری perplexity را همراه با الگوهای سطح جمله، آموزش طبقهبند و چند سیگنال دیگر در هم میآمیزند، پیش از آنکه اصلا یک عدد واحد را در گزارش چاپ کنند. تصویر کاملترِ اینکه آشکارسازهای AI در عمل چگونه کار میکنند جداگانه بررسی شده است، و توضیح میدهد بقیه این عدد از کجا میآید.
ریتم جمله به جمله، یک سیگنال مرتبط اما جداگانه است که به طور مستقل توسط burstiness checker بررسی میشود، و به میزان تنوع در سراسر یک متن میپردازد، نه به یک واژه منفرد.
هیچ یک از این اعداد نمیتواند ثابت کند چه کسی یک سند را نوشته است، از جمله Human Score برآوردی که TextPulse از یک پیشنویس ارسالشده محاسبه میکند، که متن را توصیف میکند، نه این که درباره آن حکم صادر کند. نسخه سادهشده همین ایده، یعنی تنوع واژگانی به جای احتمال کامل مدل، نیروی محرک free perplexity checker در این سایت است، و ارزش دارد آن را در برابر پاراگرافی که منشأ آن از پیش معلوم است امتحان کنید، پیش از آن که به آنچه یک گزارش درباره نوشته شخص دیگری میگوید اعتماد کنید.
perplexity checker در کنار سایر free tools TextPulse قرار دارد، بنابراین بررسی کامل یک پیشنویس، واژگان، ریتم و همه چیزهای دیگر، نیازی به باز بودن همزمان دوازده زبانه جداگانه ندارد.
perplexity یکی از دو آماری است که این سامانهها بر آن تکیه میکنند. دیگری burstiness، یعنی تغییرپذیری در طول و ساختار جمله در سراسر یک متن است، و زیر هر دو، محاسبات احتمال توکن قرار دارد که در وهله نخست این امتیاز را تولید میکند.
یک عدد در یک گزارش، پایان یک زنجیره طولانی از محاسبات است، نه آغاز یک بحث درباره این که چه کسی چیزی را نوشته است. پرسش جالبتر، وقتی محاسبات دیگر رازآلود نیستند، این است که دقیقاً چه چیزی یک سند را در وهله نخست شگفتانگیز یا قابل پیشبینی کرده است، و این پرسشی درباره خودِ نوشتار است.
Frequently Asked Questions
خیر. پریپلکسی در تشخیص AI یک سنجش آماری چنددههای از مدلسازی زبان است که نشان میدهد یک متن تا چه اندازه برای یک مدل قابل پیشبینی است. Perplexity AI یک شرکت نامرتبط است که یک محصول جستوجوی مبتنی بر AI میسازد. این دو فقط نامی مشترک دارند و هیچ چیز دیگری ندارند، و اشتباه گرفتن آنها به فهم گزارش یک آشکارساز کمکی نمیکند.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.