AI Humanization

چگونه امتیاز تشخیص AI خود را پایین بیاورید

یک مرور رتبه‌بندی‌شده از این‌که چه چیزی واقعاً امتیاز تشخیص AI را تغییر می‌دهد، از ویرایشی که به‌سختی آن را جابه‌جا می‌کند تا ویرایشی که بیشترین اثر را دارد، و این‌که چرا دنبال کردن خودِ عدد هدف نادرستی است.

6 min
Ranked list showing how to lower ai score, from synonym swaps to sentence variety to original evidence

دانشجو یک پاراگراف را از یک آشکارساز عبور می‌دهد، نمره 82 درصد را می‌بیند، دوازده واژه را با مترادف‌ها عوض می‌کند بی‌آنکه شکل حتی یک جمله را دست بزند، و دوباره بررسی می‌کند. عدد به‌سختی تکان می‌خورد. خلاصه ماجرا این است که برخی ویرایش‌ها تقریباً هیچ تغییری ایجاد نمی‌کنند، و یکی از آن‌ها بیش از همه با هم اثر می‌گذارد، به دلایلی که هیچ ربطی به فریب دادن نرم‌افزار ندارد.

این نوشته توضیح می‌دهد چگونه AI score را پایین بیاوریم، به ترتیبی که واقعاً اهمیت دارد: کدام ویرایش‌ها تقریباً ثبت نمی‌شوند، کدام‌ها عدد را به‌طور چشمگیر جابه‌جا می‌کنند، و کدام یکی بیشترین جابه‌جایی را ایجاد می‌کند، و چرا. همچنین توضیح می‌دهد که این عدد در واقع چه چیزی را می‌سنجد، زیرا پایین‌تر بودن آن فقط به یک دلیل واقعی ارزش خواستن دارد، نوشتاری روشن‌تر و دقیق‌تر، و به‌خودی‌خود هدف خوبی برای دنبال کردن نیست.

Turnitin AI writing report showing 71% detected as AI, the combined share of likely AI-generated and AI-paraphrased text in a submission
عددی که این راهنما درباره آن است: نمای کلی نگارش AI در Turnitin که یک submission را 71% AI نشان می‌دهد، همراه با هشدار خود آن که این score پیش از هر تصمیمی به بازبینی انسانی نیاز دارد.

AI Score در واقع چه چیزی را می‌سنجد

یک مدل زبانی با پیش‌بینی محتمل‌ترین واژه بعدی، بارها و بارها، می‌نویسد، و این کار یک اثر انگشت آماری مشخص تولید می‌کند: طول جمله‌هایی که در کنار هم خوشه می‌شوند، گذرهایی که از مجموعه کوچکی از گزینه‌های امن گرفته می‌شوند، و انتخاب واژه‌هایی که نزدیک به مرکز آن چیزی قرار می‌گیرند که در آن بافت انتظار می‌رود. یک نمره تشخیص AI برآوردی از این است که یک بخش متن تا چه اندازه با آن اثر انگشت مطابقت دارد، برآوردی که یک classifier آموزش‌دیده برای تشخیص آن تولید می‌کند، نه واقعیتی درباره این که چه کسی جمله را تایپ کرده است.

همه آشکارسازها عدد را به یک شکل تعریف نمی‌کنند. Turnitin states به‌صراحت می‌گوید که درصد آن «مقدار متن واجد شرایط درون ارسال را نشان می‌دهد که مدل تشخیص نوشتار AI در Turnitin تعیین می‌کند احتمالاً توسط AI تولید شده است»، و روشن می‌سازد که این سهمی از متن علامت‌گذاری‌شده است، نه یک احتمال یا نمره اطمینان. سایر آشکارسازها چیزی نزدیک‌تر به یک مقدار اطمینان درباره خود جمله خروجی می‌دهند. در هر صورت، خواندن توضیح کامل سازوکار پشت این اعداد در how AI detectors work ارزشمند است. آنچه در اینجا اهمیت دارد ساده‌تر است: عدد همیشه یک برآورد آماری است، و هر ویرایش زیر با تغییر دادن آماری که برای خواندن آن ساخته شده است عمل می‌کند، نه با پنهان کردن این واقعیت که یک مدل در کار بوده است.

جایگزینی مترادف‌ها به‌سختی یک نمره AI را جابه‌جا می‌کند

جایگزین کردن یک واژه با مترادفی کم‌کاربردتر تقریباً هیچ چیز را در الگویى که یک طبقه‌بند برای آن نمره می‌دهد تغییر نمی‌دهد، زیرا طول جمله، ساختار بندها و ریتم آن را دست‌نخورده می‌گذارد. مدلی که برای توجه به یکنواختی شکل جمله آموزش دیده است، برایش مهم نیست که جمله می‌گوید enables یا allows. آنچه برایش اهمیت دارد این است که سه جمله پیاپی تقریباً به یک اندازه طول داشته باشند و به همان شیوه آغاز شوند.

یک جمله ساده چنین خوانده می‌شود: "The platform enables users to efficiently accomplish routine tasks without additional training." اگر واژه به واژه جایگزین شود، به این صورت درمی‌آید: "The platform allows users to efficiently complete routine tasks without extra training." همان طول، همان ترتیب بندها، همان ریتم. یک خواننده ممکن است واژه‌ای اندکی متفاوت را متوجه شود. اما یک طبقه‌بند که الگوهای سطح جمله را در سراسر بند نمره‌دهی می‌کند، تقریباً چیز تازه‌ای برای کار کردن ندارد.

این استدلالی علیه اصلاح واژگان کلیشه‌ای نیست. واژه‌هایی مانند facilitate، robust و myriad ارزش حذف شدن دارند، زیرا یک خواننده دقیق متوجه آن‌ها می‌شود، و یک AI word cleaner رایگان بیشتر آن‌ها را در چند ثانیه تشخیص می‌دهد. این استدلال علیه این انتظار است که آن مرحله بار اصلی را به دوش بکشد. اگر یک امتیاز پس از یک مرحله پالایش واژگانی به‌سختی تغییر کند، این نتیجه مورد انتظار است، نه نشانه این‌که آن مرحله شکست خورده است.

مقاله خود را انسانی‌سازی کنید

متنِ کمک‌گرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژه‌های مهم یا ارجاع‌ها.

رایگان شروع کنید

تنوع جمله آن را بیشتر پیش می‌برد

یک مدل در هر نوبت یک token را پیش‌بینی می‌کند و هیچ دلیل ذاتی‌ای ندارد که جمله سوم را از جمله دوم کوتاه‌تر کند، بنابراین اگر به حال خود رها شود، یک بند در بازه‌ای محدود از طول و شکل تثبیت می‌شود. این یکنواختی، نه هیچ واژه منفردی، سیگنال قوی‌تری است، زیرا یک طبقه‌بند که بر خروجی ماشین آموزش دیده است، آن الگو را هزاران بار دیده است.

سه جمله یکنواخت چنین خوانده می‌شوند: "The results were significant. The findings supported the hypothesis. The data was analyzed using standard methods." اگر برای تنوع بازنویسی شوند، همان محتوا چنین خوانده می‌شود: "The results were significant, and they supported the hypothesis, though the standard analysis needed a second pass once two of the outlying cases were removed." اکنون یک جمله هم ادعا و هم پیچیدگی آن را با هم حمل می‌کند، با تنوع واقعی در طول و ساختار بندها در سراسر بند. این همان چیزی است که یک burstiness checker هنگام امتیازدهی به ناهمگنی اندازه‌گیری می‌کند، و به همین دلیل است که این ویرایش امتیاز را بیش از یک مرحله پالایش واژگانی جابه‌جا می‌کند.

هیچ‌یک از این‌ها انجام دادن دستی آن روی یک یا دو صفحه دشوار نیست. بند را با صدای بلند بخوانید، هر رشته‌ای از دو یا سه جمله را که طول و شکل یکسانی دارند علامت بزنید، و یکی از آن‌ها را به دو بخش تقسیم کنید یا دو جمله را با یک ویرگول که نقش واقعی دارد در هم ادغام کنید. ویرایش‌های در سطح جمله که پشت این بخش قرار دارند، گام‌به‌گام و با نمونه‌های حل‌شده بیشتر، در full walkthrough of how to humanize AI text پوشش داده شده‌اند.

شواهد خودتان بیشترین تأثیر را بر امتیاز AI می‌گذارند

یک مدل زبان به آنچه واقعاً در پروژه شما رخ داده است دسترسی ندارد. وقتی از آن خواسته می‌شود درباره یک مطالعه بنویسد، به ایمن‌ترین صورت‌بندی ممکن برمی‌گردد که با تقریباً هر مطالعه‌ای درباره همان موضوع سازگار است، زیرا تنها همان ماده را در اختیار دارد. جمله‌ای که یک ادعای مشخص را از یک منبع مشخص حمل می‌کند، جمله‌ای نیست که یک مدل صرفاً از روی prompt تولید می‌کرد، و همین فاصله است که بیشترین اثر را بر score می‌گذارد.

یک جمله کلی: "The intervention had a positive effect on outcomes for participants." این می‌تواند صدها مطالعه را توصیف کند. بازنویسی با استفاده از material خود نویسنده: "Attendance records showed the effect held only for students who came to more than six sessions, a threshold the original design had not anticipated." طولانی‌تر است، مشخص‌تر است، و فقط می‌تواند همین مطالعه را توصیف کند. یک reference model که از آن خواسته شود همان prompt را ادامه دهد، حدس نمی‌زد که جزئیات six-session وجود دارد، زیرا هیچ چیز در prompt نشان نمی‌داد که چنین چیزی وجود دارد.

این همچنین همان ویرایشی است که صرف نظر از آنچه هر detector گزارش می‌کند، بیشترین بهبود را در writing ایجاد می‌کند، و همین نکته‌ای است که ارزش دارد بر آن مکث شود. یک عدد مشخص، یک limitation نام‌برده، یک source که به‌طور مستقیم نقل شده است نه اینکه به یک ادعای مبهم paraphrase شده باشد: این‌ها یک paragraph را برای فردی که آن را می‌خواند قانع‌کننده‌تر می‌کنند، و این واقعیت که همچنین یک score را جابه‌جا می‌کنند، بیشتر به یک side effect شبیه است تا هدف.

EditTypical effect on the scoreWhy
Swap words for synonymsSmall to noneSentence length, structure and rhythm stay the same
Vary sentence length and structureModerate to largeBreaks the uniform pattern a classifier is trained to notice
Add your own evidence or claimsLargestIntroduces content a model had no way to produce from the prompt alone

چگونه AI Score را پایین بیاوریم بدون آنکه هدف نادرست را دنبال کنیم

هر عددی که در بالا آمده است یک برآورد است، نه یک حکم قطعی. Turnitin خود نیز در مستنداتش همین را می‌گوید و تصریح می‌کند که تشخیص نوشتار AI آن «ممکن است همیشه دقیق نباشد» و «نباید به عنوان تنها مبنای اقدامات نامطلوب علیه یک دانشجو استفاده شود». یک امتیاز می‌تواند به دلایلی تغییر کند که هیچ ربطی به نویسندگی ندارند، و می‌تواند روی متنی که یک نفر از صفر نوشته است، بدون تغییر بماند. برخورد با این عدد به عنوان یک واقعیت درباره این که چه کسی یک جمله را نوشته است، منشأ بیشتر اضطراب پیرامون این موضوع است، و این همان چیزی نیست که این عدد ادعا می‌کند باشد.

به همین دلیل، پایین آوردن امتیاز به خودی خود هدف خوبی نیست. دنبال کردن یک عدد می‌تواند نویسنده را به سمت ویرایش‌هایی سوق دهد که خودکارسازی آن‌ها آسان‌تر است، یک بازبینی واژگانی، چند بند بازچینش‌شده، در حالی که مهم‌ترین بخش نادیده گرفته می‌شود, افزودن ماده مشخصی که فقط خود نویسنده واقعاً در اختیار دارد. امتیاز پایین‌تری که به این شیوه به دست آمده باشد، ارزش داشتن دارد.

دنبال کردن امتیاز پایین‌تر همچنین می‌تواند یک بند را از نظر سبکی به سمت نادرست ببرد: احتیاط‌ورزی در هر ادعا، روی هم گذاشتن قیدهای احتیاطی، افزودن جمله‌های پرکننده‌ای که فقط برای شکستن ریتم وجود دارند نه برای گفتن چیزی. هیچ‌یک از این‌ها الگوی زیربنایی را اصلاح نمی‌کند، و همه آن‌ها خواندن بند را بدتر می‌کنند. ویرایش‌هایی که واقعاً امتیاز را تغییر می‌دهند، تنوع جمله‌ها و شواهد مشخص، همان ویرایش‌هایی هم هستند که نوشتار را در چارچوب خودش بهتر می‌کنند، و این یک سنجش مفید است وقتی یک ویرایش بیشتر شبیه پر کردن فضا به نظر می‌رسد تا بهبود.

AI humanizer در TextPulse، AI humanizer، ویرایش‌های سطح جمله و ساختاری بالا را به صورت یکجا بر کل یک سند اعمال می‌کند، و یک Human Score برآوردی را گزارش می‌کند که از همان سیگنال‌ها محاسبه شده است، نه این ادعا که هر آشکارساز نام‌برده‌ای حتماً آن را می‌پذیرد. اگر درست استفاده شود، یک مرحله نخست سریع برای یک سند بلند است. با این حال، هنوز نمی‌تواند آن یک چیزی را که بیشترین اثر را بر امتیاز می‌گذارد اضافه کند، زیرا هرگز هنگام وقوع کار واقعی در صحنه نبوده است. آن بخش همچنان با نویسنده می‌ماند.

دو پرسش پیشین را بهتر است ابتدا روشن کرد: آیا AI humanizerها اصلاً کار می‌کنند، و آیا استفاده از آن‌ها روی کاری که قصد دارید تحویل دهید ایمن است.

ترتیب بالا همچنین فهرست اولویت برای این است که زمان محدود پیش از یک مهلت را کجا صرف کنید. اگر زمان کم است، مرحله بازبینی مترادف‌ها را حذف کنید. پاراگرافی را که در آن جزئیاتی را بازمی‌افزایید که هیچ کس دیگری نمی‌توانست آن را نوشته باشد حذف نکنید، زیرا این همان ویرایشی است که هیچ مقدار نرم‌افزار بازنویسی نمی‌تواند به جای شما انجام دهد.

XLinkedInFacebook

سؤالات متداول

افزودن مواد خودتان، یک عدد مشخص، یک محدودیت نام‌برده، یا ادعایی که به منبعی پیوند دارد که واقعاً خوانده‌اید، امتیاز را بیش از هر ویرایش منفرد دیگری تغییر می‌دهد، زیرا یک مدل زبانی هیچ راهی برای تولید آن جزئیات از خودِ prompt نداشت. تنوع در طول جمله در رتبه بعدی قرار می‌گیرد. جایگزینی با مترادف‌ها کمترین اثر را دارد، زیرا ساختار جمله را دست‌نخورده می‌گذارد. این ترتیب، هسته این است که چگونه امتیاز ai را پایین بیاوریم، بدون این‌که فقط عدد را دستکاری کنیم.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

از تازه‌های انسان‌سازی AI باخبر بمانید

نکات مربوط به نگارش دانشگاهی، تشخیص AI و انسان‌سازی را در صندوق ورودی‌تان دریافت کنید.

بدون اسپم. هر زمان خواستید لغو اشتراک کنید.