AI Detection

لماذا يُكتشف نص الذكاء الاصطناعي؟ الأسباب الحقيقية

تفضّل عملية فك الترميز وراء كتابة الذكاء الاصطناعي الكلمات الأرجح والبنى الجملية الأرجح في كل خطوة، ولهذا يُكتشف نص الذكاء الاصطناعي حتى عندما يبدو سلسا. يتناول هذا المنشور تسطح المفردات، والتجانس النحوي، والاختيارات المحددة التي يميل الكتّاب البشر وحدهم إلى اتخاذها، من دون الرياضيات الكامنة وراء ذلك.

5 min
Why does ai text get detected: illustration of AI-generated writing sitting in a narrow band of a language model's probability distribution

إذا طلبت من نموذج لغوي إكمال الجملة "The weather today is," فلن يحاول اختيار لون مثل "cerulean" أو "apocalyptic." بل سيحاول أن يقول "sunny," أو "cloudy," أو "nice," لأن هذه كانت الكلمات التي جاءت بعد تلك العبارة في أغلب الأحيان في أي مادة دُرِّب عليها. وقد صُمِّم البرنامج الذي يختار الكلمة التالية في الجملة بحيث يفضّل هذا النوع من الإجابات تحديدًا.

لماذا يُكتشف نص الذكاء الاصطناعي؟ لأن التفضيل نفسه الذي يختار "sunny" بدلًا من "cerulean" يمتد عبر الوثيقة كلها، كلمة بعد كلمة، والنتيجة تقع داخل نطاق أضيق من الكتابة الممكنة مما يشغله الإنسان عادة. ولا يحتاج الكاشف إلى الإمساك بكذبة. كل ما يحتاج إليه هو أن يلاحظ أن المقطع يظل يقع في ذلك النطاق الضيق.

لا يحتاج ما يلي إلى صيغة. تقوم الآلية على فكرة واحدة، تتكرر على ثلاثة مقاييس مختلفة: اختيار الكلمة، وبنية الجملة، والتفصيل المحدد الذي يصل إليه الكاتب من غير تفكير فيه. وكل واحد من هذه المقاييس يغذي السؤال الأوسع حول كيف تعمل كواشف الذكاء الاصطناعي فعليًا، ويسهل رؤيته أكثر بعد تسمية السبب الجذري.

لماذا يُكتشف نص الذكاء الاصطناعي؟ الجواب المختصر

يُكتشف نص الذكاء الاصطناعي لأن عملية فك الترميز التي تحول تنبؤات النموذج إلى جمل مكتملة صُممت لتفضيل الكلمات المحتملة في كل خطوة، وأن القيام بذلك باستمرار، لآلاف الكلمات المتتالية، ينتج كتابة تشغل شريحة أضيق من اللغة مما يشغله الإنسان عادة. ويمكن لأداة إحصائية أن تجد هذا الضيق حتى عندما تكون كل جملة سليمة نحويًا ودقيقة من حيث الوقائع.

تنتج عن هذا السبب الواحد ثلاثة أعراض. يضيق المعجم نحو الكلمة الشائعة الأكثر أمانًا. وتضيق بنية الجملة نحو عدد قليل من الأشكال المفضلة. كما أن الاختيار المحدد، غير المحتمل قليلًا، الذي يقوم به الإنسان شبه تلقائيًا، أي الكلمة الغريبة، أو الاعتراض الجانبي، أو التفصيل الذي لا يكلف شيئًا لإدراجه وكل شيء لتوقعه، يميل إلى ألا يظهر أصلًا.

كيف يختار نموذج لغوي كلمته التالية

لو تُرك نموذج اللغة لنفسه، فإنه سيعرض ببساطة قائمته الكاملة المرتبة للكلمات التالية الممكنة ويترك شيئًا آخر يختار. عمليًا، تتولى استراتيجية فك الترميز هذا الاختيار تلقائيًا، كلمة بعد كلمة، وتغيّر الاستراتيجية المستخدمة شكل المخرجات حتى عندما لا يتغير النموذج الأساسي أبدًا.

يختار فك الترميز الجشع دائمًا الكلمة الواحدة الأكثر احتمالًا. في الورقة التي قدّمت أخذ العينات النواتي بوصفه حلًا، لاحظ Ari Holtzman والمؤلفون المشاركون أن اتباع هذه الاستراتيجية يؤدي إلى نص، على حد تعبيرهم، "باهت ومكرر على نحو غريب". ويقع بحث الحزمة، الذي يتتبع عدة استمرارات مرجحة في الوقت نفسه قبل الاستقرار على واحدة، في نسخة مشابهة من المشكلة نفسها.

تعيد استراتيجيات أخذ العينات بعض العشوائية، ولكن بطريقة مضبوطة. تضبط درجة الحرارة مدى حدة تفضيل النموذج لاختياراته العليا قبل سحب كلمة. أما أخذ العينات النواتي، الذي يسمى أحيانًا top-p، فيقتطع التوزيع إلى أصغر مجموعة من الكلمات التي تتجاوز احتمالاتها المجمعة عتبة معينة، ثم يسحب فقط من تلك المجموعة، وقد وُصف في الورقة الأصلية بأنه أخذ عينات من نواة ديناميكية للتوزيع بدلًا من ذيله غير الموثوق.

حتى أقل هذه الإعدادات حتمية لا يزال يسحب من قائمة مختصرة مبنية على ما يعدّه النموذج بالفعل محتملًا. لم يُولَّد الكتابة البشرية قط عبر ترتيب مفردات والسحب من أعلاها، لذلك فهي تتجاوز تلك القائمة المختصرة باستمرار. أحيانًا يسكن المعنى في الكلمة التي لم تكن موجودة أصلًا في القائمة.

أضف الطابع البشري إلى بحثك الخاص

حوّل نصك المدعوم بالذكاء الاصطناعي واجعله يبدو بشريًا، من دون المساس بالكلمات المهمة أو الاستشهادات.

ابدأ مجانًا

تسطح المفردات: كلمات أقل وأكثر أمانًا

تسطح المفردات هو النسخة على مستوى الكلمة من العادة نفسها. عند كل نقطة في الجملة، يمكن لعشرات الكلمات أن تواصلها على نحو معقول، لكن قلة منها تقف أعلى بكثير من البقية في ترتيب النموذج، ويواصل فك الترميز الهبوط على تلك القلة. وعند مضاعفة هذا الاختيار عبر كل جملة في وثيقة ما، يضيق نطاق الكلمات المستخدمة فعليًا بصورة قابلة للقياس مقارنة بكتابة بشرية ذات طول مماثل.

يتراكم هذا الأثر بدلًا من أن يبقى ثابتًا. النموذج الذي يختار الكلمة الأعلى ترتيبًا في الجملة الأولى يكون أكثر ميلًا إلى إنشاء سياق تكون فيه الكلمة الأعلى ترتيبًا في الجملة الثانية شائعة أيضًا، لأن الكلمات الشائعة تميل إلى أن تتبع الكلمات الشائعة. أما الكاتب البشري فيقطع هذا الانجراف باستمرار، فيلجأ إلى المصطلح التقني المحدد، أو الفعل غير المألوف قليلًا، أو الكلمة التي تسمّي الشيء الفعلي بدلًا من تقريب آمن له. ويظهر هذا الفرق في صورة معجم عملي أصغر يمكن قياسه في النسخة المولدة، حتى عندما تصف النسختان الحقائق الأساسية نفسها.

هذه خاصية للمقطع كله، لا لاختيار كلمة واحدة بعينها. كلمة آمنة واحدة لا تثبت شيئًا. أما صفحة كاملة من هذه الكلمات، جملة بعد جملة وهي تلجأ إلى المرتبة نفسها من المفردات الشائعة، فهي ما صُممت إشارة الكلمة على مستوى المفردة في الكاشف لرصده فعلًا.

التجانس النحوي: الأشكال نفسها، مكررة

التجانس النحوي هو النسخة على مستوى الجملة. وهو لا يتعلق بطول الجملة، بل بعدد الأشكال النحوية المتميزة التي يستخدمها المقطع: كيف تبدأ الجمل، وكيف ترتبط الجمل الفرعية بعضها ببعض، وكم مرة تؤدي كلمة انتقالية وظيفة الربط بين فكرة وأخرى. النموذج الذي يواصل التنبؤ بالبنية التالية الأرجح إحصائيًا يستقر على دوران محدود من الأشكال ويكررها.

يمكن للفقرة أن تنوع أطوال جملها ومع ذلك تظل مسطحة نحويًا إذا كانت كل جملة تتبع الشكل نفسه من فاعل وفعل ومتمم، أو تبدأ بالنوع نفسه من الانتقال، أو تنتهي بالطريقة نفسها. تكمن قابلية التنبؤ في النمط، لا في عدد الكلمات، وهو تمييز يُتناول بمزيد من التفصيل في الدليل إلى ما الذي تقيسه burstiness فعلًا.

ما الذي يضيّق النطاقما الذي يميل إليه النص المحسّن لفك الترميزما الذي تميل إليه الكتابة البشرية
اختيار الكلماتيستقر على الكلمة الشائعة الأكثر احتمالًا في كل خطوةيلجأ إلى الكلمة المحددة أو الأقل شيوعًا التي تسمّي الشيء الفعلي
بداية الجملةيكرر تدويرًا صغيرًا من بدايات انتقالية آمنةينوع طريقة بدء الجملة، بما في ذلك بدايات قد يصنفها النموذج على أنها أقل احتمالًا
بنية الجملة الفرعيةيكرر شكلًا أو شكلين مفضلين نحويًا عبر المقطعيمزج بين البنى البسيطة والمعقدة بحسب ما تحتاجه الجملة

الاختيارات التي يميل إلى اتخاذها الإنسان وحده

الوجه الآخر للنطاق الضيق هو ما يقع خارجه. فالشخص الذي يصف أحداثًا حقيقية يلجأ إلى الرقم الدقيق بدلًا من رقم مستدير، ويعترف بالجزء الذي لم ينجح، ويقطع الجملة ليصححها في منتصف الفكرة، أو يختار كلمة صحيحة لا نمطية. وكل واحد من هذه الاختيارات هو، من منظور نموذج لغوي، رمز منخفض الاحتمال، وهو بالضبط النوع الذي صُمم فك الترميز لتجنبه.

ولا يعني أي من ذلك أن الكتابة المحددة أو غير المألوفة آمنة من كل إشارة، أو أن الكتابة السليمة الطليقة مشبوهة بحكم الأصل. فقد تقع فقرة المنهجية، أو بند قانوني، أو مسودة نهائية خضعت لتحرير كثيف ضمن نطاق ضيق لأسباب لا علاقة لها بنموذج، ولهذا فإن الدرجة الواحدة هي وصف لنمط لا حكم على من كتب النص.

إن رؤية موضع مسودتك ضمن ذلك النطاق أكثر فائدة من التخمين. يقيس فاحص perplexity المجاني وفاحص burstiness في TextPulse قابلية التنبؤ على مستوى الكلمة والإيقاع من جملة إلى أخرى على نحو منفصل، بحيث يظهر المعجم المسطح وبنية الجملة المتكررة بوصفهما إشارتين مختلفتين بدلًا من رقم واحد ممزوج.

ينتج عن هذا صفحتان أضيق نطاقًا. كيف يكشف Turnitin عن AI تحديدًا هي إحداهما، والفرق بين درجة التشابه لديه ودرجة AI لديه هي الأخرى، لأن الاثنين يُخلطان عادةً أحدهما بالآخر.

كلاهما يقع ضمن مجموعة الأدوات المجانية الأوسع، لكل من يريد أن يرى النمط بنفسه بدلًا من أن يثق برقم واحد ثقة عمياء.

XLinkedInFacebook

الأسئلة الشائعة

لماذا يُكتشف نص الذكاء الاصطناعي؟ لأن عملية فك الترميز التي تولده تفضّل الكلمات الأرجح والبنى الجملية الأرجح في كل خطوة، مما ينتج كتابة تقع في نطاق أضيق من اللغة مقارنة بما تفعله الكتابة البشرية المعتادة. يقيس الكاشف هذا الضيق بدل قراءة المعنى، لذلك يمكن أن يظهر النمط حتى في النثر السلس والدقيق.

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

ابقَ على اطلاع على إضفاء الطابع البشري على AI

احصل على نصائح حول الكتابة الأكاديمية، وكشف AI، وإضفاء الطابع البشري على النصوص مباشرة إلى بريدك الوارد.

لا رسائل مزعجة. يمكنك إلغاء الاشتراك في أي وقت.