چگونه امتیاز تشخیص AI خود را پایین بیاورید
یک مرور رتبهبندیشده از اینکه چه چیزی واقعاً امتیاز تشخیص AI را تغییر میدهد، از ویرایشی که بهسختی آن را جابهجا میکند تا ویرایشی که بیشترین اثر را دارد، و اینکه چرا دنبال کردن خودِ عدد هدف نادرستی است.
دانشجو یک پاراگراف را از یک آشکارساز عبور میدهد، نمره 82 درصد را میبیند، دوازده واژه را با مترادفها عوض میکند بیآنکه شکل حتی یک جمله را دست بزند، و دوباره بررسی میکند. عدد بهسختی تکان میخورد. خلاصه ماجرا این است که برخی ویرایشها تقریباً هیچ تغییری ایجاد نمیکنند، و یکی از آنها بیش از همه با هم اثر میگذارد، به دلایلی که هیچ ربطی به فریب دادن نرمافزار ندارد.
این نوشته توضیح میدهد چگونه AI score را پایین بیاوریم، به ترتیبی که واقعاً اهمیت دارد: کدام ویرایشها تقریباً ثبت نمیشوند، کدامها عدد را بهطور چشمگیر جابهجا میکنند، و کدام یکی بیشترین جابهجایی را ایجاد میکند، و چرا. همچنین توضیح میدهد که این عدد در واقع چه چیزی را میسنجد، زیرا پایینتر بودن آن فقط به یک دلیل واقعی ارزش خواستن دارد، نوشتاری روشنتر و دقیقتر، و بهخودیخود هدف خوبی برای دنبال کردن نیست.

AI Score در واقع چه چیزی را میسنجد
یک مدل زبانی با پیشبینی محتملترین واژه بعدی، بارها و بارها، مینویسد، و این کار یک اثر انگشت آماری مشخص تولید میکند: طول جملههایی که در کنار هم خوشه میشوند، گذرهایی که از مجموعه کوچکی از گزینههای امن گرفته میشوند، و انتخاب واژههایی که نزدیک به مرکز آن چیزی قرار میگیرند که در آن بافت انتظار میرود. یک نمره تشخیص AI برآوردی از این است که یک بخش متن تا چه اندازه با آن اثر انگشت مطابقت دارد، برآوردی که یک classifier آموزشدیده برای تشخیص آن تولید میکند، نه واقعیتی درباره این که چه کسی جمله را تایپ کرده است.
همه آشکارسازها عدد را به یک شکل تعریف نمیکنند. Turnitin states بهصراحت میگوید که درصد آن «مقدار متن واجد شرایط درون ارسال را نشان میدهد که مدل تشخیص نوشتار AI در Turnitin تعیین میکند احتمالاً توسط AI تولید شده است»، و روشن میسازد که این سهمی از متن علامتگذاریشده است، نه یک احتمال یا نمره اطمینان. سایر آشکارسازها چیزی نزدیکتر به یک مقدار اطمینان درباره خود جمله خروجی میدهند. در هر صورت، خواندن توضیح کامل سازوکار پشت این اعداد در how AI detectors work ارزشمند است. آنچه در اینجا اهمیت دارد سادهتر است: عدد همیشه یک برآورد آماری است، و هر ویرایش زیر با تغییر دادن آماری که برای خواندن آن ساخته شده است عمل میکند، نه با پنهان کردن این واقعیت که یک مدل در کار بوده است.
جایگزینی مترادفها بهسختی یک نمره AI را جابهجا میکند
جایگزین کردن یک واژه با مترادفی کمکاربردتر تقریباً هیچ چیز را در الگویى که یک طبقهبند برای آن نمره میدهد تغییر نمیدهد، زیرا طول جمله، ساختار بندها و ریتم آن را دستنخورده میگذارد. مدلی که برای توجه به یکنواختی شکل جمله آموزش دیده است، برایش مهم نیست که جمله میگوید enables یا allows. آنچه برایش اهمیت دارد این است که سه جمله پیاپی تقریباً به یک اندازه طول داشته باشند و به همان شیوه آغاز شوند.
یک جمله ساده چنین خوانده میشود: "The platform enables users to efficiently accomplish routine tasks without additional training." اگر واژه به واژه جایگزین شود، به این صورت درمیآید: "The platform allows users to efficiently complete routine tasks without extra training." همان طول، همان ترتیب بندها، همان ریتم. یک خواننده ممکن است واژهای اندکی متفاوت را متوجه شود. اما یک طبقهبند که الگوهای سطح جمله را در سراسر بند نمرهدهی میکند، تقریباً چیز تازهای برای کار کردن ندارد.
این استدلالی علیه اصلاح واژگان کلیشهای نیست. واژههایی مانند facilitate، robust و myriad ارزش حذف شدن دارند، زیرا یک خواننده دقیق متوجه آنها میشود، و یک AI word cleaner رایگان بیشتر آنها را در چند ثانیه تشخیص میدهد. این استدلال علیه این انتظار است که آن مرحله بار اصلی را به دوش بکشد. اگر یک امتیاز پس از یک مرحله پالایش واژگانی بهسختی تغییر کند، این نتیجه مورد انتظار است، نه نشانه اینکه آن مرحله شکست خورده است.
مقاله خود را انسانیسازی کنید
متنِ کمکگرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژههای مهم یا ارجاعها.
تنوع جمله آن را بیشتر پیش میبرد
یک مدل در هر نوبت یک token را پیشبینی میکند و هیچ دلیل ذاتیای ندارد که جمله سوم را از جمله دوم کوتاهتر کند، بنابراین اگر به حال خود رها شود، یک بند در بازهای محدود از طول و شکل تثبیت میشود. این یکنواختی، نه هیچ واژه منفردی، سیگنال قویتری است، زیرا یک طبقهبند که بر خروجی ماشین آموزش دیده است، آن الگو را هزاران بار دیده است.
سه جمله یکنواخت چنین خوانده میشوند: "The results were significant. The findings supported the hypothesis. The data was analyzed using standard methods." اگر برای تنوع بازنویسی شوند، همان محتوا چنین خوانده میشود: "The results were significant, and they supported the hypothesis, though the standard analysis needed a second pass once two of the outlying cases were removed." اکنون یک جمله هم ادعا و هم پیچیدگی آن را با هم حمل میکند، با تنوع واقعی در طول و ساختار بندها در سراسر بند. این همان چیزی است که یک burstiness checker هنگام امتیازدهی به ناهمگنی اندازهگیری میکند، و به همین دلیل است که این ویرایش امتیاز را بیش از یک مرحله پالایش واژگانی جابهجا میکند.
هیچیک از اینها انجام دادن دستی آن روی یک یا دو صفحه دشوار نیست. بند را با صدای بلند بخوانید، هر رشتهای از دو یا سه جمله را که طول و شکل یکسانی دارند علامت بزنید، و یکی از آنها را به دو بخش تقسیم کنید یا دو جمله را با یک ویرگول که نقش واقعی دارد در هم ادغام کنید. ویرایشهای در سطح جمله که پشت این بخش قرار دارند، گامبهگام و با نمونههای حلشده بیشتر، در full walkthrough of how to humanize AI text پوشش داده شدهاند.
شواهد خودتان بیشترین تأثیر را بر امتیاز AI میگذارند
یک مدل زبان به آنچه واقعاً در پروژه شما رخ داده است دسترسی ندارد. وقتی از آن خواسته میشود درباره یک مطالعه بنویسد، به ایمنترین صورتبندی ممکن برمیگردد که با تقریباً هر مطالعهای درباره همان موضوع سازگار است، زیرا تنها همان ماده را در اختیار دارد. جملهای که یک ادعای مشخص را از یک منبع مشخص حمل میکند، جملهای نیست که یک مدل صرفاً از روی prompt تولید میکرد، و همین فاصله است که بیشترین اثر را بر score میگذارد.
یک جمله کلی: "The intervention had a positive effect on outcomes for participants." این میتواند صدها مطالعه را توصیف کند. بازنویسی با استفاده از material خود نویسنده: "Attendance records showed the effect held only for students who came to more than six sessions, a threshold the original design had not anticipated." طولانیتر است، مشخصتر است، و فقط میتواند همین مطالعه را توصیف کند. یک reference model که از آن خواسته شود همان prompt را ادامه دهد، حدس نمیزد که جزئیات six-session وجود دارد، زیرا هیچ چیز در prompt نشان نمیداد که چنین چیزی وجود دارد.
این همچنین همان ویرایشی است که صرف نظر از آنچه هر detector گزارش میکند، بیشترین بهبود را در writing ایجاد میکند، و همین نکتهای است که ارزش دارد بر آن مکث شود. یک عدد مشخص، یک limitation نامبرده، یک source که بهطور مستقیم نقل شده است نه اینکه به یک ادعای مبهم paraphrase شده باشد: اینها یک paragraph را برای فردی که آن را میخواند قانعکنندهتر میکنند، و این واقعیت که همچنین یک score را جابهجا میکنند، بیشتر به یک side effect شبیه است تا هدف.
| Edit | Typical effect on the score | Why |
|---|---|---|
| Swap words for synonyms | Small to none | Sentence length, structure and rhythm stay the same |
| Vary sentence length and structure | Moderate to large | Breaks the uniform pattern a classifier is trained to notice |
| Add your own evidence or claims | Largest | Introduces content a model had no way to produce from the prompt alone |
چگونه AI Score را پایین بیاوریم بدون آنکه هدف نادرست را دنبال کنیم
هر عددی که در بالا آمده است یک برآورد است، نه یک حکم قطعی. Turnitin خود نیز در مستنداتش همین را میگوید و تصریح میکند که تشخیص نوشتار AI آن «ممکن است همیشه دقیق نباشد» و «نباید به عنوان تنها مبنای اقدامات نامطلوب علیه یک دانشجو استفاده شود». یک امتیاز میتواند به دلایلی تغییر کند که هیچ ربطی به نویسندگی ندارند، و میتواند روی متنی که یک نفر از صفر نوشته است، بدون تغییر بماند. برخورد با این عدد به عنوان یک واقعیت درباره این که چه کسی یک جمله را نوشته است، منشأ بیشتر اضطراب پیرامون این موضوع است، و این همان چیزی نیست که این عدد ادعا میکند باشد.
به همین دلیل، پایین آوردن امتیاز به خودی خود هدف خوبی نیست. دنبال کردن یک عدد میتواند نویسنده را به سمت ویرایشهایی سوق دهد که خودکارسازی آنها آسانتر است، یک بازبینی واژگانی، چند بند بازچینششده، در حالی که مهمترین بخش نادیده گرفته میشود, افزودن ماده مشخصی که فقط خود نویسنده واقعاً در اختیار دارد. امتیاز پایینتری که به این شیوه به دست آمده باشد، ارزش داشتن دارد.
دنبال کردن امتیاز پایینتر همچنین میتواند یک بند را از نظر سبکی به سمت نادرست ببرد: احتیاطورزی در هر ادعا، روی هم گذاشتن قیدهای احتیاطی، افزودن جملههای پرکنندهای که فقط برای شکستن ریتم وجود دارند نه برای گفتن چیزی. هیچیک از اینها الگوی زیربنایی را اصلاح نمیکند، و همه آنها خواندن بند را بدتر میکنند. ویرایشهایی که واقعاً امتیاز را تغییر میدهند، تنوع جملهها و شواهد مشخص، همان ویرایشهایی هم هستند که نوشتار را در چارچوب خودش بهتر میکنند، و این یک سنجش مفید است وقتی یک ویرایش بیشتر شبیه پر کردن فضا به نظر میرسد تا بهبود.
AI humanizer در TextPulse، AI humanizer، ویرایشهای سطح جمله و ساختاری بالا را به صورت یکجا بر کل یک سند اعمال میکند، و یک Human Score برآوردی را گزارش میکند که از همان سیگنالها محاسبه شده است، نه این ادعا که هر آشکارساز نامبردهای حتماً آن را میپذیرد. اگر درست استفاده شود، یک مرحله نخست سریع برای یک سند بلند است. با این حال، هنوز نمیتواند آن یک چیزی را که بیشترین اثر را بر امتیاز میگذارد اضافه کند، زیرا هرگز هنگام وقوع کار واقعی در صحنه نبوده است. آن بخش همچنان با نویسنده میماند.
دو پرسش پیشین را بهتر است ابتدا روشن کرد: آیا AI humanizerها اصلاً کار میکنند، و آیا استفاده از آنها روی کاری که قصد دارید تحویل دهید ایمن است.
ترتیب بالا همچنین فهرست اولویت برای این است که زمان محدود پیش از یک مهلت را کجا صرف کنید. اگر زمان کم است، مرحله بازبینی مترادفها را حذف کنید. پاراگرافی را که در آن جزئیاتی را بازمیافزایید که هیچ کس دیگری نمیتوانست آن را نوشته باشد حذف نکنید، زیرا این همان ویرایشی است که هیچ مقدار نرمافزار بازنویسی نمیتواند به جای شما انجام دهد.
سؤالات متداول
افزودن مواد خودتان، یک عدد مشخص، یک محدودیت نامبرده، یا ادعایی که به منبعی پیوند دارد که واقعاً خواندهاید، امتیاز را بیش از هر ویرایش منفرد دیگری تغییر میدهد، زیرا یک مدل زبانی هیچ راهی برای تولید آن جزئیات از خودِ prompt نداشت. تنوع در طول جمله در رتبه بعدی قرار میگیرد. جایگزینی با مترادفها کمترین اثر را دارد، زیرا ساختار جمله را دستنخورده میگذارد. این ترتیب، هسته این است که چگونه امتیاز ai را پایین بیاوریم، بدون اینکه فقط عدد را دستکاری کنیم.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.