AI Detection

ما هي الحيرة في كشف الذكاء الاصطناعي؟

الحيرة هي الرقم الذي ينتجه نموذج لغوي لوصف مدى دهشته من اختياراتك للكلمات. يتتبع هذا المنشور المقياس إلى أصله في 1977، ويشرح الصيغة، ويوضح لماذا يمكن أن تسجل الفقرة نفسها درجات مختلفة تبعًا للنموذج الذي يقوم بالقراءة.

آخر تحديث في 6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

ابحث عن perplexity وAI detection معًا، وستجد أن عدة نتائج من الأعلى تتعلق في النهاية بمنتج لا صلة له بذلك: محرك بحث مدعوم بالذكاء الاصطناعي يحمل أيضًا اسم Perplexity. أما المقياس الذي يبلّغ عنه الكاشف فعليًا فلا يجمعه بتلك الشركة أي شيء سوى الكلمة نفسها. فهو يأتي من أبحاث التعرف على الكلام التي سبقت GPTZero أو محرك البحث بعقود، ويقيس شيئًا أضيق من كليهما: مدى دهشة نموذج اللغة بالكلمات الموجودة بالفعل على الصفحة.

إذن ما هو perplexity في AI detection؟ perplexity هو درجة تصف مدى جودة نموذج اللغة في التنبؤ بالكلمات الدقيقة في مقطع ما، وتنتج عن أخذ متوسط احتمالات النموذج نفسه وتحويل النتيجة إلى رقم واحد. تعني الدرجة المنخفضة أن النموذج ظل يتوقع بشكل صحيح. وتعني الدرجة المرتفعة أنه ظل يتفاجأ.

الفكرة أقدم من أي كاشف AI في السوق، وهي في حد ذاتها لا تقول شيئًا عن من كتب وثيقة ما. وما إن تصبح الحسابات وراء الرقم مرئية، حتى تتوقف الدرجة في التقرير عن أن تبدو حكمًا، وتبدأ في الظهور على حقيقتها: وصفًا لاختيار الكلمات.

Free perplexity checker scoring word-level predictability: a repetitive paragraph scores 62 of 100 estimated word variation with a 51% type-token ratio
تنوع معجمي منخفض في perplexity checker: 44 كلمة فريدة من أصل 87، لذا تحمل الكلمات نفسها جزءًا كبيرًا جدًا من النص. وهذه القابلية للتنبؤ هي بالضبط ما تقرأه الكواشف القائمة على perplexity.

ما هو perplexity في AI detection؟

الاستعصاء هو مقياس مستعار من نمذجة اللغة. وهو يقيّم مدى جودة تنبؤ النموذج بالكلمات المحددة التي تظهر في مقطع ما، ويعرض تلك الدرجة بوصفها رقماً واحداً. تطبق الكواشف المقياس نفسه على مستند مُقدَّم, فعدد منخفض، أي إن تخمينات النموذج طابقت الكلمات الفعلية عن قرب، يُقرأ بوصفه علامة على التأليف الآلي، وعدد مرتفع يُقرأ بوصفه علامة على التأليف البشري. لا يقرأ أي شيء في هذا الحساب حجة المستند أو استشهاداته أو موضوعه. إنه يقرأ فقط مدى توقع كل كلمة، واحدة تلو الأخرى.

لم تخترع الكواشف هذا المقياس. لقد استعارته من أداة كانت أنظمة التعرف على الكلام والترجمة الآلية تستخدمها بالفعل منذ عقود للحكم على مدى جودة تنبؤ النموذج باللغة العادية، ثم أعادت توظيفه بوصفه مؤشراً على التأليف، وهي مهمة لم يُبنَ أصلاً للقيام بها.

لا علاقة لأي من هذا بمحرك البحث غير المرتبط المذكور سابقاً. إن الاستعصاء الذي يبلغه الكاشف ليس شركة قط، ولا يُكتب بحرف كبير: إنه خاصية إحصائية بسيطة لتسلسل من الكلمات، تُحسب من جديد انطلاقاً من أي نص يُعطى له.

كيف يُحسب الاستعصاء فعلياً

يعود هذا الحساب إلى ما هو أبعد من أي منتج من منتجات الذكاء الاصطناعي. قدّم Frederick Jelinek وRobert Mercer وLalit Bahl وJames Baker الاستعصاء في 1977 لقياس مدى صعوبة مهمة التعرف على الكلام بالنسبة إلى نموذج إحصائي، وذلك قبل عقود من تطبيق المصطلح على مقال أو تقرير مختبر. ولم يتغير التعريف منذ ذلك الحين.

في كل موضع داخل المستند، يخرج النموذج احتمالاً للكلمة التي تأتي فعلاً بعده، شيئاً مثل 0.72 لانتقال شائع أو 0.03 لانتقال غير مألوف. ويحسب الاستعصاء متوسط اللوغاريتمات لتلك الاحتمالات عبر المقطع كله، ثم يعكس المتوسط بأسّ.

الأس في there's يفعل أكثر مما يبدو. إن أخذ متوسط احتمالات اللوغاريتم هو بالضبط ما نفعله عندما نحسب الانتروبيا التقاطعية، وهي الطريقة في نظرية المعلومات للتعبير عن عدد البتات التي تحتاج إليها لترميز تسلسل ما، بالنظر إلى التنبؤات التي يقدمها نموذج. لكن الحيرة تعيد عدد البتات إلى شيء يمكننا فهمه على نحو أفضل, وهو عدد فعلي من الخيارات، لا مجرد عد مجرد للبتات.

ما يبقى من تلك الحسابات له قراءة واضحة، تكاد تكون مادية. النموذج الذي يكون واثقا تماما في كل مرة ينتج حيرة مقدارها 1، وهو الحد الأدنى للمقياس. أما النموذج الذي يعامل كل موضع على أنه تعادل متكافئ بين 80 كلمة متساوية الاحتمال فينتج حيرة مقدارها 80.

معظم الوثائق الحقيقية تقع في مكان ما بين هذين الطرفين، والمكان الدقيق يعتمد على الكاتب، والموضوع، وعلى النموذج الذي يقوم بالقراءة.

حوّل مقالك إلى صيغة بشرية

حوّل النص الذي استعنت فيه بالذكاء الاصطناعي واجعله يبدو بشريًا، من دون المساس بالكلمات المهمة أو الاستشهادات.

ابدأ مجانًا

لماذا تميل الكتابة البشرية إلى الحصول على درجة مختلفة

توقعات النموذج تُبنى بالكامل مما سبق، كلمة بعد كلمة. بعد عبارة 'the treatment group showed a statistically', تكون الغالبية الساحقة من الاستكمالات السليمة هي 'significant', والنموذج المدرب على حجم كبير من الكتابة العلمية يمنح تلك الكلمة احتمالا مرتفعا دون تردد. أما الكاتب البشري الذي يصل إلى العبارة نفسها فقد يختار 'significant' أيضا، لأن العبارة نفسها من سمات هذا النوع. لكن الفجوة تظهر في مواضع أخرى, في الاسم الذي يُختار بعد جملتين، أو في الاستطراد المضاف بين قوسين، أو في الرقم الذي يُذكر إلى منزلة عشرية غير مألوفة بدلا من منزلة مستديرة.

ليس في ذلك أي حيلة. عندما يحاول شخص يكتب عن بيانات حقيقية أن يصل إلى الرقم الدقيق، أو الوصف المحدد، أو الكلمة الأضيق قليلا، فإنه يسعى إلى أشياء صحيحة بالنسبة إلى العمل نفسه لا بالنسبة إلى النوع الأدبي. وكل واحد من تلك الاختيارات يكلف النموذج قدرا أكبر قليلا من المفاجأة. والمفاجأة هي ما صُممت الدرجة لتجمعه.

الاستدلال يقوم بعمل أكبر مما يمكن للقياس أن يدعمه. تقيس الحيرة قابلية التنبؤ مباشرة. وهي تستنتج التأليف فقط بافتراض أن الكتابة القابلة للتنبؤ نادرة لدى البشر وشائعة لدى النماذج، وهو افتراض يكون عادة معقولًا وأحيانًا خاطئًا بطريقة محددة يمكن التعرف عليها، لأن قابلية التنبؤ خاصية يمكن أن يمتلكها النص لأسباب لا علاقة لها بمن كتبه.

لماذا يمكن أن تحصل الفقرة نفسها على درجات مختلفة

الدرجة أيضًا أقل قابلية للنقل مما تبدو عليه، لأن قياسها لا يتم أبدًا في فراغ. تُحسب الحيرة دائمًا مقارنة بتدريب نموذج مرجعي واحد محدد، وهذا الاعتماد يخلق مشكلات لا يمكن لأي تعريف منفرد أن يوضحها وحده.

العاملما الذي يتغيرلماذا يحدث ذلك
أي نموذج يقوم بالقراءةيمكن أن تحصل الفقرة نفسها على درجة منخفضة لدى نموذج ودرجة مرتفعة لدى آخرلا تُقاس الحيرة إلا مقابل بيانات تدريب نموذج واحد، وقد دُرِّبت النماذج المختلفة على نصوص مختلفة
ما إذا كان المقطع نصًا معاد إنتاجه على نطاق واسعيمكن لوثيقة تاريخية شهيرة أو تعريف من كتاب دراسي أن تحصل على حيرة منخفضة حتى عندما يكتب شخص كل كلمة منها في الكاشفتشير Pangram Labs إلى إعلان الاستقلال بوصفه مثالًا, فهو يُقتبس كثيرًا في بيانات التدريب إلى درجة أن النموذج لا يجد أي جملة فيه مثيرة للاستغراب
ما إذا كان الكاشف يستطيع رؤية احتمالات الرموز أصلًاالنماذج التجارية المغلقة مثل ChatGPT وGemini وClaude لا تعرض احتمالات كل كلمة التي تحتاجها الحيرةتقدّر الكواشف الدرجة باستخدام نموذج مفتوح بديل بدلًا من حساب الحيرة مقابل النموذج الذي أنتج النص فعليًا

لا يجعل أيٌّ من هذا الرقم بلا معنى، بل يجعله أكثر خطورة إذا ما أُريد الاعتماد عليه بوصفه حكماً مستقلاً. كانت وثائق GPTZero الخاصة قد نشرت مرة قاعدة تقريبية، مفادها أن perplexity التي تتجاوز 85 تُقرأ على أنها أقرب إلى النص البشري، لكن عتبة بائع واحد على نموذج واحد لا تنتقل إلى أداة مختلفة تُقاس مقابل أداة أخرى مختلفة. إن الكاشف الذي يقدّم درجة واحدة يضغط جميع العوامل المذكورة أعلاه في رقم واحد من دون أن يبيّن أيٌّ منها قام بالدور الحاسم.

ما الذي تخبرك به درجة perplexity فعلاً

تدمج الكواشف التجارية perplexity مع أنماط مستوى الجملة، وتدريب المصنّف، وعدة إشارات أخرى قبل أن تطبع رقماً واحداً في التقرير. وتُعرض الصورة الأوسع عن كيفية عمل كواشف AI فعلاً في موضع آخر، وهي تشرح من أين يأتي ما تبقى من ذلك الرقم.

الإيقاع من جملة إلى جملة إشارة ذات صلة لكنها منفصلة، ويغطيها فاحص burstiness على أساسه الخاص، وهو ينظر إلى مقدار التباين الموجود عبر المقطع بدلاً من النظر إلى أي كلمة منفردة.

لا يمكن لأيٍّ من هذه الأرقام أن يثبت من كتب وثيقة ما، بما في ذلك Human Score المقدَّر الذي يحسبه TextPulse من مسودة مقدَّمة، وهو يصف النص بدلاً من أن يصدر حكماً عليه. وتقوم نسخة مبسطة من الفكرة نفسها، وهي تنوع المفردات بدلاً من الاحتمال الكامل للنموذج، بتشغيل فاحص perplexity المجاني في هذا الموقع، ومن المفيد تجربته على فقرة معروف أصلها مسبقاً قبل الوثوق بما يقوله تقرير عن أصل نص شخص آخر.

يقع فاحص perplexity إلى جانب بقية الأدوات المجانية في TextPulse، لذلك فإن المرور الكامل على مسودة، والمفردات، والإيقاع، وكل شيء آخر، لا يحتاج إلى فتح اثني عشر تبويباً منفصلاً في الوقت نفسه.

الحيْرة هي إحدى الإحصائيتين اللتين تعتمد عليهما هذه الأنظمة. أما الأخرى فهي التذبذب، أي التباين في طول الجمل وبنيتها عبر مقطع نصي، وتحت كليهما تكمن حسابات احتمالية الرموز التي تنتج الدرجة في المقام الأول.

إن الرقم الوارد في التقرير هو نهاية سلسلة طويلة من الحسابات، وليس بداية جدل حول من كتب شيئًا ما. والسؤال الأكثر إثارة للاهتمام، بعد أن تتوقف الحسابات عن كونها غامضة، هو ما الذي جعل وثيقة ما مفاجئة أو متوقعة على وجه التحديد في المقام الأول، وهذا سؤال يتعلق بالكتابة نفسها.

XLinkedInFacebook

الأسئلة الشائعة

لا. الحيرة في كشف الذكاء الاصطناعي هي قياس إحصائي قديم يعود إلى عقود من نمذجة اللغة، ويصف مدى قابلية توقع مقطع من النص بالنسبة إلى نموذج. Perplexity AI شركة غير ذات صلة تقدم منتج بحث مدعومًا بالذكاء الاصطناعي. يشترك الاثنان في الاسم ولا شيء غير ذلك، وخلطهما لن يساعدك على فهم تقرير الكاشف.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

ابقَ على اطلاع على إضفاء الصيغة البشرية على نصوص الذكاء الاصطناعي

احصل على نصائح حول الكتابة الأكاديمية، وكشف الذكاء الاصطناعي، وإضفاء الصيغة البشرية، تصل إلى صندوق بريدك.

لا رسائل مزعجة. يمكنك إلغاء الاشتراك في أي وقت.