AI Detection

ما هي الحيرة في كشف الذكاء الاصطناعي؟

الحيرة هي الرقم الذي ينتجه نموذج لغوي لوصف مدى دهشته من اختياراتك للكلمات. يتتبع هذا المنشور المقياس إلى أصله في 1977، ويشرح الصيغة، ويوضح لماذا يمكن للمقطع نفسه أن يحصل على درجات مختلفة تبعًا للنموذج الذي يقوم بالقراءة.

6 min
What is perplexity in AI detection? A language model scoring how predictable each word in a sentence is.

ابحث عن perplexity وكشف الذكاء الاصطناعي معًا، وستتضح أن عدة نتائج من الأعلى تتعلق بمنتج لا صلة له بالموضوع: محرك بحث مدعوم بالذكاء الاصطناعي يحمل أيضًا اسم Perplexity. المقياس الذي يبلغه الكاشف فعليًا لا يشترك مع تلك الشركة في شيء سوى الكلمة. إنه يأتي من أبحاث التعرف على الكلام الأقدم بعقود من GPTZero أو محرك البحث، وهو يقيس شيئًا أضيق من كليهما: مدى دهشة نموذج اللغة من الكلمات الموجودة بالفعل على الصفحة.

إذن ما هو perplexity في كشف الذكاء الاصطناعي؟ perplexity هو درجة تصف مدى جودة نموذج اللغة في التنبؤ بالكلمات الدقيقة في مقطع ما، وتنتج عن طريق أخذ متوسط احتمالات النموذج نفسه وتحويل النتيجة إلى رقم واحد. تعني الدرجة المنخفضة أن النموذج ظل يتوقع بشكل صحيح. وتعني الدرجة المرتفعة أنه ظل يتعرض للمفاجأة.

هذه الفكرة أقدم من أي كاشف للذكاء الاصطناعي في السوق، وهي في حد ذاتها لا تقول شيئًا عن من كتب المستند. وما إن تصبح الحسابات وراء الرقم مرئية، حتى تتوقف الدرجة في التقرير عن أن تبدو حكمًا، وتبدأ في أن تبدو كما هي في الواقع: وصفًا لاختيار الكلمات.

ما هو perplexity في كشف الذكاء الاصطناعي؟

perplexity هو قياس مستعار من نمذجة اللغة. وهو يمنح درجة لكيفية تنبؤ النموذج بالكلمات المحددة التي تظهر في مقطع ما، ويعرض تلك الدرجة في صورة رقم واحد. تطبق الكواشف القياس نفسه على مستند مُقدَّم: فالرقم المنخفض، الذي يعني أن تخمينات النموذج طابقت الكلمات الفعلية عن قرب، يُقرأ بوصفه علامة على التأليف الآلي، والرقم المرتفع يُقرأ بوصفه علامة على التأليف البشري. لا شيء في الحساب يقرأ حجة المستند أو استشهاداته أو موضوعه. إنه يقرأ فقط مدى توقع كل كلمة، واحدة تلو الأخرى.

لم تخترع الكواشف هذا القياس. لقد استعاروا أداة كانت أنظمة التعرف على الكلام والترجمة الآلية تستخدمها بالفعل منذ عقود للحكم على مدى جودة تنبؤ النموذج باللغة العادية، وأعادوا توظيفها بوصفها مؤشرًا بديلًا على التأليف، وهو دور لم تُبنَ أصلًا من أجله.

لا علاقة لأي من هذا بمحرك البحث غير المرتبط المذكور سابقا. إن قيمة الحيرة التي يبلغ عنها الكاشف ليست شركة أبدا، وليست مكتوبة بحرف كبير أبدا، بل هي خاصية إحصائية بسيطة لتسلسل من الكلمات، تُحسب من جديد انطلاقا من أي نص يُعطى لها.

كيف تُحسب الحيرة فعليا

يرجع هذا الحساب إلى ما هو أبعد من أي منتج من منتجات الذكاء الاصطناعي. قدم Frederick Jelinek وRobert Mercer وLalit Bahl وJames Baker مفهوم الحيرة في 1977 لقياس مدى صعوبة مهمة التعرف على الكلام بالنسبة إلى نموذج إحصائي، وذلك قبل عقود من تطبيق المصطلح على مقال أو تقرير مختبر. ولم يتغير التعريف منذ ذلك الحين.

في كل موضع داخل مستند، يخرج النموذج احتمالا للكلمة التي تأتي فعلا بعد ذلك، مثل 0.72 لانتقال شائع أو 0.03 لانتقال غير مألوف. وتقوم الحيرة بمتوسط لوغاريتمات تلك الاحتمالات عبر المقطع كله، ثم تعكس المتوسط بأس أسّي.

إن الأس في there's يفعل أكثر مما يبدو. إن أخذ متوسط الاحتمالات اللوغاريتمية هو بالضبط ما نفعله عندما نحسب الإنتروبيا التقاطعية، وهي الطريقة النظرية المعلوماتية للتعبير عن عدد البتات التي تحتاج إليها لترميز تسلسل ما بالنظر إلى التنبؤات التي يقدمها نموذج. لكن الحيرة تعيد عدد البتات إلى شيء نفهمه على نحو أفضل، وهو عدد فعال من الخيارات، لا مجرد عد مجرد للبتات.

ما يبقى من تلك الحسابات له قراءة واضحة، تكاد تكون مادية. فالنموذج الذي يكون واثقا تماما في كل مرة ينتج حيرة مقدارها 1، وهو الحد الأدنى للمقياس. أما النموذج الذي يعامل كل موضع على أنه تعادل بين ثمانين كلمة متساوية الاحتمال فينتج حيرة مقدارها 80.

تقع معظم المستندات الحقيقية في مكان ما بين هذين الطرفين، ويعتمد الموضع الدقيق على الكاتب، والموضوع، والنموذج الذي يقوم بالقراءة.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

لماذا تميل الكتابة البشرية إلى الحصول على درجات مختلفة

تُبنى توقعات النموذج بالكامل على ما سبق، كلمة بعد كلمة. بعد العبارة "the treatment group showed a statistically"، تكون الغالبية الساحقة من الاستكمالات السليمة هي "significant"، والنموذج الذي دُرِّب على حجم كبير من الكتابة العلمية يمنح تلك الكلمة احتمالًا مرتفعًا دون تردد. وقد يصل الكاتب البشري إلى العبارة نفسها ويختار "significant" أيضًا، لأن العبارة نفسها من السمات الثابتة لهذا النوع. لكن الفجوة تظهر في موضع آخر: في الاسم الذي يُختار بعد جملتين، أو في الاستطراد المضاف بين قوسين، أو في الرقم الذي يُذكر إلى منزلة عشرية غير مألوفة بدلًا من منزلة مستديرة.

ليس في ذلك أي خدعة. عندما يحاول شخص يكتب عن بيانات حقيقية أن يصل إلى الرقم الدقيق، أو الوصف المحدد، أو الكلمة الأضيق قليلًا، فإنه يسعى إلى أشياء تكون صحيحة بالنسبة إلى العمل نفسه لا بالنسبة إلى النوع الأدبي. وكل واحد من هذه الاختيارات يكلف النموذج قدرًا أكبر قليلًا من المفاجأة. والمفاجأة هي ما تُبنى الدرجة على جمعه.

الاستدلال يقوم بعمل أكبر مما يمكن للقياس أن يسنده. تقيس Perplexity قابلية التنبؤ مباشرة. وهي تستدل على التأليف فقط بافتراض أن الكتابة القابلة للتنبؤ نادرة بين البشر وشائعة بين النماذج، وهو افتراض يكون عادة معقولًا وأحيانًا خاطئًا بطريقة محددة يمكن التعرف إليها، لأن قابلية التنبؤ صفة يمكن للنص أن يمتلكها لأسباب لا علاقة لها بمن كتبه.

لماذا يمكن أن تحصل الفقرة نفسها على درجات مختلفة

كما أن الدرجة أقل قابلية للنقل مما تبدو عليه، لأنها لا تُقاس أبدًا في فراغ. تُحسب Perplexity دائمًا مقارنة بتدريب نموذج مرجعي واحد محدد، وهذا الاعتماد يخلق مشكلات لا يمكن لأي تعريف منفرد أن يُظهرها وحده.

العاملما الذي يتغيرلماذا يحدث ذلك
أي نموذج يقوم بالقراءةيمكن للفقرة نفسها أن تحصل على درجة منخفضة لدى نموذج واحد ودرجة مرتفعة لدى نموذج آخرلا يُقاس الارتباك إلا مقارنة ببيانات تدريب نموذج واحد، وقد دُرِّبت النماذج المختلفة على نصوص مختلفة
ما إذا كان المقطع نصا معاد إنتاجه على نطاق واسعيمكن لوثيقة تاريخية شهيرة أو تعريف في كتاب دراسي أن تحصل على درجة ارتباك منخفضة حتى عندما يكون شخص قد كتب كل كلمة منها في الكاشفتشير Pangram Labs إلى إعلان الاستقلال بوصفه مثالا, فهو يُقتبس كثيرا جدا في بيانات التدريب بحيث يجد النموذج كل جملة فيه غير مفاجئة
ما إذا كان الكاشف يستطيع رؤية احتمالات الرموز على الإطلاقالنماذج التجارية المغلقة مثل ChatGPT وGemini وClaude لا تعرض احتمالات كل كلمة التي يحتاجها الارتباكتقرّب الكواشف الدرجة باستخدام نموذج مفتوح بديل بدلا من حساب الارتباك مقابل النموذج الذي أنتج النص فعلا

لا يجعل أي من ذلك الرقم بلا معنى، لكنه يجعله أكثر خطرا إذا جرى الاعتماد عليه بوصفه حكما قائما بذاته. كانت وثائق GPTZero نفسها قد نشرت يوما قاعدة تقريبية، مفادها أن الارتباك الذي يتجاوز 85 يُقرأ على أنه أقرب إلى أن يكون بشريا، لكن عتبة بائع واحد على نموذج واحد لا تنتقل إلى أداة مختلفة تقاس مقابل أداة أخرى. إن الكاشف الذي يعرض درجة واحدة يضغط كل العوامل المذكورة أعلاه في رقم واحد من دون أن يذكر أيها قام بالعمل.

ما الذي تخبرك به درجة الارتباك فعلا

تدمج الكواشف التجارية الارتباك مع أنماط مستوى الجملة، وتدريب المصنف، وعدة إشارات أخرى قبل أن تطبع أي رقم واحد في التقرير. وتتناول صورة أشمل عن كيف تعمل كواشف AI فعلا بشكل منفصل، وهي تشرح من أين يأتي بقية ذلك الرقم.

الإيقاع من جملة إلى جملة هو إشارة مرتبطة لكنه منفصلة، ويغطيها burstiness checker وفق شروطه الخاصة، وهو ينظر إلى مقدار التباين الموجود عبر مقطع نصي بدلًا من النظر إلى أي كلمة منفردة.

لا يمكن لأي من هذه الأرقام أن يثبت من كتب مستندًا، بما في ذلك Human Score المقدَّر الذي يحسبه TextPulse من مسودة مقدمة، والذي يصف النص بدلًا من أن يصدر حكمًا عليه. وتقوم نسخة مبسطة من الفكرة نفسها، أي تنوع المفردات بدلًا من الاحتمال الكامل للنموذج، بتشغيل free perplexity checker في هذا الموقع، ومن المفيد تجربته على فقرة معروف أصلها مسبقًا قبل الوثوق بما يقوله تقرير عن أصل نص شخص آخر.

يقع perplexity checker إلى جانب بقية free tools الخاصة بـ TextPulse، لذلك فإن الفحص الكامل لمسودة، والمفردات، والإيقاع، وكل ما عدا ذلك، لا يحتاج إلى فتح اثني عشر تبويبًا منفصلًا في الوقت نفسه.

Perplexity هي إحدى الإحصائيتين اللتين تعتمد عليهما هذه الأنظمة. أما الأخرى فهي burstiness، أي التباين في طول الجمل وبنيتها عبر مقطع نصي، وتحت كليهما تكمن حسابات احتمال الرموز التي تنتج الدرجة في الأصل.

إن الرقم الوارد في التقرير هو نهاية سلسلة طويلة من الحسابات، وليس بداية جدل حول من كتب شيئًا ما. والسؤال الأكثر إثارة للاهتمام، بعد أن تتوقف الحسابات عن كونها غامضة، هو ما الذي جعل مستندًا ما مفاجئًا أو متوقعًا على وجه التحديد في المقام الأول، وهذا سؤال يتعلق بالكتابة نفسها.

Frequently Asked Questions

لا. الحيرة في كشف الذكاء الاصطناعي هي قياس إحصائي قديم يعود إلى عقود من نمذجة اللغة، ويصف مدى قابلية مقطع من النص للتنبؤ من قبل نموذج. Perplexity AI هي شركة غير مرتبطة بذلك، تقدم منتج بحث مدعومًا بالذكاء الاصطناعي. يشترك الاثنان في الاسم ولا شيء غير ذلك، وخلطهما لن يساعدك على فهم تقرير الكاشف.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

ما هي الحيرة في كشف الذكاء الاصطناعي؟ | TextPulse.ai