AI Humanization

آیا انسان‌سازهای AI واقعاً کار می‌کنند؟

تقریباً هر صفحه‌ای که برای این پرسش رتبه می‌گیرد، توسط شرکتی فروخته می‌شود که خودِ یک humanizer برای فروش دارد. در عوض، اینجا سازوکار را می‌بینید: این ابزارها واقعاً چه چیزی را تغییر می‌دهند، چرا بخشی از آن امتیاز یک آشکارساز را جابه‌جا می‌کند و بخشی نه، و یک بازنویسی تهاجمی چه خطری برای معنا و ارجاعات دارد.

6 min
Do AI humanizers work: original and humanized AI text compared side by side

عبارت "do ai humanizers work" را در نوار جستجو وارد کنید و تقریباً هر صفحه‌ای که پاسخی می‌دهد، در حال فروش یکی از آن‌هاست. این یک توطئه نیست، بلکه فقط یک انگیزه آشکار است: شرکتی که یک ابزار بازنویسی ساخته است، قرار نیست با مواردی شروع کند که در آن‌ها شکست می‌خورد. آنچه واقعاً رخ می‌دهد، جایی میان این دو قرار دارد و به این بستگی دارد که "work" چه معنایی داشته باشد. یک ابزار AI humanizer ویژگی‌های مشخص و قابل اندازه‌گیری یک بند را تغییر می‌دهد. برخی از این تغییرها نمره یک detector را جابه‌جا می‌کنند. برخی دیگر چنین نمی‌کنند. چند مورد نیز به بهای واقعیِ آنچه بند واقعاً می‌گوید تمام می‌شوند.

یک AI humanizer ابزاری است که متن تولیدشده توسط AI را بازنویسی می‌کند تا اثر انگشت آماری آن را تغییر دهد, واژه‌گزینی, طول جمله, عادت‌های نشانه‌گذاری, و ویژگی‌هایی که یک detector واقعاً اندازه‌گیری می‌کند. این‌که آیا یک humanizer مشخص برای استفاده در یک تکلیف نمره‌دار ایمن است یا نه, یا این‌که در مقایسه با یک ابزار paraphrasing ساده چگونه عمل می‌کند, پرسش‌های جداگانه‌ای با پاسخ‌های خاص خودشان هستند. این بحث محدودتر است: بازنویسی از نظر مکانیکی دقیقاً چه می‌کند, و کدام بخش‌های آن سازوکار واقعاً نمره را جابه‌جا می‌کنند.

این یک نتیجه آزمون نیست. TextPulse یک مقایسه کنترل‌شده میان ابزارهای humanizer انجام نداده است, و حتی اگر انجام داده بودیم, یک پیروزی مبتنی بر تجربه شخصی ارزش بسیار اندکی داشت. اما فهم سازوکارها مفید خواهد بود, این‌که وقتی برای تغییر یک بند کاری انجام می‌دهید چه رخ می‌دهد, چرا برخی از آن‌ها نمره را جابه‌جا می‌کنند و برخی نه, و برای به‌دست آوردن یک عدد پایین‌تر چه خطری را می‌پذیرید. آنچه در ادامه می‌آید بر پژوهش‌های منتشرشده درباره این‌که detectorها چگونه دور زده می‌شوند, و نیز بر آزمون‌های منتشرشده خودِ رسانه‌های دیگر تکیه دارد تا سازوکار را توضیح دهد: چه چیزی در یک بند تغییر می‌کند, چرا بخشی از آن نمره را جابه‌جا می‌کند و بخشی نه, و یک بازنویسی سنگین در ازای یک عدد پایین‌تر چه خطری دارد.

یک AI humanizer در عمل چه چیزی را تغییر می‌دهد

هر humanizer موجود در بازار، ترکیبی از سه کار را انجام می‌دهد: واژه‌های منفرد را با مترادف‌های کم‌قابل‌پیش‌بینی‌تر جایگزین می‌کند، جمله‌ها را بازآرایی می‌کند یا به هم می‌پیوندد تا یکنواختی طول آن‌ها را برهم بزند، و گاهی نیز به‌جای تنظیم کردن یک بخش، آن را به‌طور کامل بازنویسی می‌کند. مورد اول تقریباً در حد تغییرات ظاهری است. مورد دوم مهم‌ترین بخش است، زیرا تنوع طول جمله، burstiness، یکی از دو سنجشی است که بیشتر آشکارسازها پیش از تولید امتیاز محاسبه می‌کنند، در کنار این‌که انتخاب واژه‌ها در هر لحظه تا چه اندازه قابل‌پیش‌بینی است.

تفاوت در یک جمله به‌خوبی دیده می‌شود. "The study employed a robust methodology" اگر واژه به واژه جایگزین شود، به "The study used a strong approach," تبدیل می‌شود که اندکی روان‌تر خوانده می‌شود و شکل جمله را تقریباً تغییر نمی‌دهد. اما اگر بازساخت شود، به "Because the sample skewed young, the researchers ran a mixed-methods design rather than a single survey." تبدیل می‌شود. این یک طول متفاوت، یک ساختار بند متفاوت، و میزان دیگری از غافلگیری برای مدلی است که می‌کوشد حدس بزند چه چیزی در ادامه می‌آید. فقط نسخه دوم به سیگنالی دست می‌زند که یک آشکارساز برای سنجش آن ساخته شده است.

این تمایز نظری نیست. یک آشکارساز برای معناخوانی متن را نمی‌خواند. بلکه امتیاز می‌دهد که یک بخش تا چه اندازه با الگویی که یک مدل زبانی تولید می‌کند مطابقت دارد، و این دقیقاً همان الگویی است که راهنمای ما درباره how to humanize AI text به شما می‌آموزد که آن را به‌صورت دستی، یک جمله در هر بار، برهم بزنید. یک ابزار humanizer همین دسته از کار را در مقیاسی بسیار بزرگ‌تر و در یک گذر انجام می‌دهد.

کدام‌یک از این تغییرات واقعاً امتیاز را جابه‌جا می‌کنند

روشن‌ترین شواهد از پژوهشگرانی می‌آید که یک مدل بازنویسی اختصاصی، DIPPER، را دقیقاً برای آزمودن این نوع حمله ساختند. وقتی DIPPER را در برابر DetectGPT، یک روش آشکارسازی که به‌خوبی مطالعه شده است، اجرا کردند، بازنویسی‌های DIPPER دقت آشکارسازی را از 70.3 percent به 4.6 percent کاهش داد، آن هم با نرخ ثابت 1 percent false-positive rate، و پژوهشگران گزارش کردند که بازنویسی‌ها معنای متن منبع را به‌طور محسوس تغییر ندادند. این یک اثر اندازه‌گیری‌شده است، نه یک ادعای بازاریابی: بازساختن یک بخش در سطح جمله می‌تواند امتیاز را به‌طور چشمگیری جابه‌جا کند.

این همان شکاف میان آن نتیجه و صفحه بازاریابی یک humanizer تجاری است. بخش عمده دلیل این است که نتایج میان ابزارها و میان افرادی که آن‌ها را بررسی می‌کنند، تا این اندازه متفاوت است. DIPPER یک مدل پژوهشی است. این مدل برای ارزیابی در برابر یک detector مشخص که به‌صورت عمومی مستند شده بود، در شرایط کنترل‌شده ساخته و آزمون شد. برای همه موارد از یک شدت بازنویسی یکسان استفاده شد. ابزاری که در مرورگر اجرا می‌شود، همان دسته از ویرایش را انجام می‌دهد, جایگزینی واژه‌ها و بازسازی جمله‌ها. اما همان نوع کنترل را که یک مقاله پژوهشی بر detector در سوی دیگر یا بر کیفیت بازنویسی دارد، در اختیار ندارد.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

چرا یک امتیاز پایین در یک detector به detector دیگر منتقل نمی‌شود

detectorها همان چیز را از همان نقطه مرجع اندازه‌گیری نمی‌کنند. یک مطلب همراه درباره how AI detectors work سازوکار را به‌طور کامل توضیح می‌دهد، اما نکته مرتبط در اینجا ساده است: هر detector در برابر مدل مرجع خودش امتیازدهی می‌شود، بنابراین ویرایشی که برای یکی غیرقابل پیش‌بینی به نظر می‌رسد، ممکن است برای دیگری همچنان عادی به نظر برسد.

پژوهشگرانی که مجموعه‌ای از detectorهای تجاری و متن‌باز را در برابر ویرایش، بازنویسی، prompt دادن و حمله‌های ترکیبی تحت فشار آزمون قرار دادند، دریافتند که عملکرد به‌طور میانگین 35 percent کاهش یافت، اما نه به‌صورت یکنواخت. نتیجه آن‌ها این بود که تقریباً هیچ‌یک از detectorها در برابر همه انواع حمله پایدار نماندند، و هر کدام به‌جای یک ضعف مشترک، رخنه‌های متفاوت و مشخصی داشتند. یک آزمون در دنیای واقعی از یک humanizer واحد همان الگو را نشان داد: همان بند بازنویسی‌شده در دو detector جداگانه 100 percent AI گرفت، در سومی نیز 100 percent ماند، و در چهارمی به 88 percent کاهش یافت، و همه این‌ها تنها از یک بار عبور از یک ابزار به دست آمد.

بازنویسی تهاجمی چه هزینه‌ای دارد

در بازاریابی این دسته، به‌ندرت از حالت شکست در سوی دیگر یک بازنویسی سنگین یاد می‌شود: ابزاری که آن‌قدر از یک جمله را تغییر می‌دهد که امتیاز آن جابه‌جا شود، می‌تواند آن‌قدر هم از آن را تغییر دهد که معنا از دست برود. یک رسانه همان بندِ تولیدشده توسط AI را از میان ده ابزار humanizer مختلف عبور داد و نتایج را با متن اصلی سنجید. چند مورد جمله‌هایی تولید کردند که دیگر به‌عنوان English قابل تحلیل نبودند. یکی دستور «Tap your Apple ID» را به «Faucet your Apple ID» بازنویسی کرد. دیگری «Understanding LinkedIn Premium» را به «Grasping LinkedIn Premium» تبدیل کرد، و داوران یادآور شدند که این عبارت «اصلاً همان معنا را منتقل نمی‌کند». جمع‌بندی کلی آنان این بود که این ابزارها «به نظر نمی‌رسید هیچ درکی از معنای مقاله به‌عنوان یک کل داشته باشند».

نوشتار دانشگاهی نسبت به چنین خطایی کمتر بخشنده است تا یک پست وبلاگی درباره محصول. اگر یک واژه احتیاطی با ادعایی قوی‌تر جایگزین شود، «may indicate» به «shows» بازنویسی شود، این تغییر مشخص می‌کند که یک citation دقیقاً برای پشتیبانی از چه چیزی به کار می‌رود، و اگر جمله‌ای پیرامون یک نقل‌قول بازآرایی شود، ممکن است citation را از ادعایی که در اصل کنار آن قرار داشت جدا کند. یک in-text citation fixer می‌تواند citationای را که از جمله خود جدا شده است به جای درستش بازگرداند، بی‌آنکه جزئیاتی را که منبع هرگز از آن پشتیبانی نکرده است جعل کند، اما نمی‌تواند به شما بگوید که آیا خودِ ادعا هنوز با آنچه آن منبع می‌گوید مطابقت دارد یا نه. در هر صورت، بخشی که citationهای فراوان دارد ارزش آن را دارد که دستی بررسی شود.

نوع ویرایشاثر معمول بر نمره یک آشکارسازچه چیزی ممکن است خراب شود
جایگزینی واژه‌های منفرد با مترادف‌هااندک، و اغلب در محدوده نویز معمول آشکارسازیک واژه احتیاطی می‌تواند به ادعایی قوی‌تر از آنچه منبع پشتیبانی می‌کند تبدیل شود
بازآرایی یا ادغام جمله‌هابزرگ‌ترین و پایدارترین اثر، این همان چیزی است که burstiness می‌سنجدیک ارجاع ممکن است از ادعایی که در اصل کنار آن قرار داشت جدا شود
بازنویسی کامل یک بخشدر آشکارسازی که ابزار بر پایه آن تنظیم شده است بزرگ، و در جاهای دیگر غیرقابل پیش‌بینیبیشترین خطرِ تولیدی که دیگر اصلا به‌صورت یک جمله قابل تجزیه نباشد
افزودن پرکننده‌هایی مانند غلط‌های تایپی پراکنده یا حاشیه‌پردازی‌هاحداقل تا هیچ، این کار ظاهری است، نه ساختاریبرای خواننده انسانی مصنوعی به نظر می‌رسد، بی‌آنکه الگوی زیرین را اصلاح کند

پس، آیا humanizers هوش مصنوعی کار می‌کنند؟

آنچه شواهد بالا در واقع نشان می‌دهد این است که humanizers به‌طور قابل اعتماد ویژگی‌های آماری‌ای را که یک آشکارساز می‌سنجد تغییر می‌دهند، و این یک اثر واقعی و مکانیکی است، نه تبلیغاتی. با این حال، آنها به‌طور قابل اعتماد عبور از هر آشکارساز مشخصی را تضمین نمی‌کنند، زیرا آشکارسازها بنا به طراحی با یکدیگر اختلاف دارند، و هرچه یک ابزار برای رسیدن به آن تضمین، بازنویسی را تهاجمی‌تر انجام دهد، احتمال بیشتری دارد که در این میان چیزی از معنا را از دست بدهد.

"Do humanizers work" در واقع سه پرسش است که در یک جمله لباس پوشیده‌اند: آیا ابزار الگو را تغییر می‌دهد، آیا آن تغییر در برابر آشکارساز مشخصی که برای شما مهم است باقی می‌ماند، و آیا جمله هنوز همان چیزی را می‌گوید که شما منظور داشتید. پاسخ پرسش اول، بر پایه شواهد بالا، معمولا بله است. دو مورد دیگر به ابزار، آشکارساز، و میزان تهاجمی بودن اجرای این فرایند بستگی دارند.

ابزار AI humanizer در TextPulse بر پایه همان مبادله طراحی شده است، نه بر پایه یک وعده. این ابزار یک سند را بازنویسی می‌کند و یک Human Score تخمینی گزارش می‌دهد که از همان سیگنال‌هایی محاسبه می‌شود که آشکارسازها استفاده می‌کنند، از جمله ریتم جمله و پیش‌بینی‌پذیری واژه، نه این ادعا که هر آشکارساز نام‌برده‌ای حتماً آن را می‌پذیرد. یک طرح رایگان دقیقاً به این دلیل وجود دارد که بتوانید پیش از آنکه تصمیم بگیرید آیا این مبادله در جدول بالا برای یک سند کامل ارزش دارد یا نه، ببینید یک pass واقعاً چه چیزهایی را خط به خط تغییر می‌دهد.

کار کردن و برای استفاده ایمن بودن دو آزمون جداگانه هستند، و پرسش ایمنی صفحه‌ای جداگانه دارد. نسخه دقیق‌تر آن نیز همین‌طور است: آنچه Turnitin هنگام مواجهه با متن humanized انجام می‌دهد.

ابزارهایی که ارزش اعتماد دارند، آن‌هایی هستند که نشان می‌دهند چه چیزی تغییر کرده است و به شما اجازه می‌دهند آن را بررسی کنید، نه آن‌هایی که از شما می‌خواهند به یک درصد در یک صفحه فرود اعتماد کنید. پیش از آنکه هر چیزی را ارسال کنید، پاراگراف بازنویسی‌شده را در برابر متن اصلی بخوانید، همان‌گونه که پیش‌نویس نخست یک دستیار پژوهشی را بررسی می‌کنید، زیرا humanizer از نظر کارکرد دقیقاً همین است.

Frequently Asked Questions

آیا انسان‌سازهای AI به‌طور قابل اعتماد آن‌قدر کار می‌کنند که بتوانند عبور را تضمین کنند؟ هیچ ابزار واحدی نمی‌تواند این را با قطعیت بگوید. انسان‌سازها ساختار جمله و پیش‌بینی‌پذیری واژه‌ها را تغییر می‌دهند، همان سیگنال‌هایی که آشکارسازها اندازه‌گیری می‌کنند، بنابراین امتیازها اغلب پایین می‌آیند، اما آشکارسازها عمداً با یکدیگر اختلاف دارند. این‌که آیا تغییر از آشکارساز مشخصی که برای شما مهم است عبور می‌کند یا نه، پرسشی جداگانه و کم‌قابل‌پیش‌بینی‌تر از این است که آیا اصلاً تغییری رخ داده است یا نه.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.