AI Humanization

آیا AI Humanizers واقعاً کار می‌کنند؟

تقریباً هر صفحه‌ای که برای این پرسش رتبه می‌گیرد، توسط شرکتی فروخته می‌شود که خود یک humanizer برای فروش دارد. در اینجا به‌جای آن، سازوکار را می‌بینید: این ابزارها واقعاً چه چیزی را تغییر می‌دهند، چرا بخشی از آن امتیاز یک detector را جابه‌جا می‌کند و بخشی نه، و یک بازنویسی تهاجمی چه خطری برای معنا و ارجاعات دارد.

به‌روزرسانی شده در 6 min
Do AI humanizers work: original and humanized AI text compared side by side

عبارت "do ai humanizers work" را در نوار جستجو وارد کنید و تقریباً هر صفحه‌ای که به آن پاسخ می‌دهد، در حال فروش یکی از آن‌هاست. این یک توطئه نیست، بلکه صرفاً یک انگیزه آشکار است: شرکتی که یک ابزار بازنویسی ساخته است، قرار نیست مواردی را که در آن شکست می‌خورد، در صدر قرار دهد. آنچه واقعاً رخ می‌دهد، جایی میان این دو است و به این بستگی دارد که "work" چه معنایی داشته باشد. یک ابزار humanizer مبتنی بر AI ویژگی‌های مشخص و قابل اندازه‌گیری یک بند را تغییر می‌دهد. برخی از این تغییرها امتیاز یک detector را جابه‌جا می‌کنند. برخی دیگر چنین نمی‌کنند. چند مورد نیز بهایی واقعی برای آنچه بند واقعاً می‌گوید، دارند.

یک AI humanizer ابزاری است که متن تولیدشده توسط AI را بازنویسی می‌کند تا اثر انگشت آماری آن را تغییر دهد, انتخاب واژه, طول جمله, عادت‌های نشانه‌گذاری, ویژگی‌هایی که یک detector واقعاً اندازه‌گیری می‌کند. این که آیا یک humanizer مشخص برای استفاده در یک تکلیف نمره‌دار ایمن است یا نه, یا این که در مقایسه با یک ابزار paraphrasing ساده چگونه عمل می‌کند, پرسش‌هایی جداگانه با پاسخ‌های خاص خود هستند. این بحث محدودتر است: بازنویسی از نظر مکانیکی دقیقاً چه می‌کند, و کدام بخش‌های این سازوکار واقعاً امتیاز را جابه‌جا می‌کنند.

این یک نتیجه آزمون نیست. TextPulse یک مقایسه کنترل‌شده میان ابزارهای humanizer انجام نداده است, و حتی اگر انجام داده بودیم, یک پیروزی مبتنی بر روایت شخصی ارزش بسیار کمی داشت. اما فهم سازوکارها, آنچه هنگام انجام کارهایی برای تغییر یک بند رخ می‌دهد, این که چرا برخی از آن‌ها امتیاز را جابه‌جا می‌کنند و برخی نه, و این که برای رسیدن به یک عدد پایین‌تر چه خطری را می‌پذیرید, مفید خواهد بود. آنچه در ادامه می‌آید بر پژوهش‌های منتشرشده درباره شیوه‌های دور زدن detectorها و نیز بر آزمون‌های منتشرشده خودِ رسانه‌های دیگر تکیه دارد تا سازوکار را توضیح دهد: چه چیزی در یک بند تغییر می‌کند, چرا برخی از آن‌ها امتیاز را جابه‌جا می‌کنند و برخی نه, و یک بازنویسی سنگین در ازای یک عدد پایین‌تر چه خطری دارد.

یک AI humanizer در عمل چه چیزی را تغییر می‌دهد

هر humanizer موجود در بازار ترکیبی از سه کار را انجام می‌دهد: واژه‌های منفرد را با مترادف‌های کم‌قابل‌پیش‌بینی‌تر جایگزین می‌کند، جمله‌ها را بازآرایی می‌کند یا با هم ادغام می‌کند تا یکنواختی طول آن‌ها را برهم بزند، و گاهی نیز به‌جای تنظیم کردن یک بخش، آن را به‌طور کامل بازنویسی می‌کند. مورد اول تقریباً در حد تغییرات ظاهری است. مورد دوم مهم‌ترین است، زیرا تنوع طول جمله، burstiness، یکی از دو سنجشی است که بیشتر detectorها پیش از تولید نمره محاسبه می‌کنند، در کنار این‌که انتخاب واژه‌ها در هر لحظه تا چه اندازه قابل‌پیش‌بینی است.

تفاوت در یک جمله به‌خوبی دیده می‌شود. "The study employed a robust methodology" اگر واژه‌به‌واژه جایگزین شود به "The study used a strong approach," تبدیل می‌شود که اندکی روان‌تر خوانده می‌شود و شکل جمله را به‌سختی تغییر می‌دهد. اگر بازساخت شود، به "Because the sample skewed young, the researchers ran a mixed-methods design rather than a single survey." تبدیل می‌شود. این یک طول متفاوت، یک ساختار بند متفاوت، و میزان دیگری از غافلگیری برای مدلی است که می‌کوشد پیش‌بینی کند چه چیزی در ادامه می‌آید. فقط نسخه دوم به سیگنالی دست می‌زند که detector برای سنجش آن ساخته شده است.

این تمایز نظری نیست. یک detector برای معنا خواندن نمی‌کند. آنچه را امتیاز می‌دهد این است که یک بخش تا چه اندازه با الگویی که یک language model تولید می‌کند مطابقت دارد، و این دقیقاً همان الگویی است که راهنمای ما درباره how to humanize AI text به شما می‌آموزد که آن را به‌صورت دستی، یک جمله در هر بار، برهم بزنید. یک humanizer tool همان دسته از کار را در مقیاسی بسیار بزرگ‌تر و در یک گذر انجام می‌دهد.

کدام‌یک از آن تغییرها واقعاً نمره را جابه‌جا می‌کند

روشن‌ترین شواهد از پژوهشگرانی به دست می‌آید که یک مدل بازنویسی اختصاصی، DIPPER، را به‌طور خاص برای آزمودن این نوع حمله ساختند. وقتی این مدل را روی DetectGPT، یک روش شناسایی که به‌خوبی مطالعه شده است، اجرا کردند، بازنویسی‌های DIPPER دقت شناسایی را از 70.3 درصد به 4.6 درصد، با نرخ مثبت کاذب ثابت 1 درصد، کاهش دادند، و پژوهشگران گزارش کردند که این بازنویسی‌ها معنای متن مبدأ را به‌طور محسوس تغییر ندادند. این یک اثر اندازه‌گیری‌شده است، نه یک ادعای بازاریابی: بازسازمان‌دهی یک بخش در سطح جمله می‌تواند یک امتیاز را به‌میزان زیادی جابه‌جا کند.

این همان فاصله میان آن نتیجه و صفحه بازاریابی یک humanizer تجاری است. این تا حد زیادی دلیل آن است که نتایج میان ابزارها و میان افرادی که آن‌ها را بررسی می‌کنند تا این اندازه متفاوت است. DIPPER یک مدل پژوهشی است. این مدل برای ارزیابی در برابر یک آشکارساز مشخص و مستندشده عمومی، در شرایط کنترل‌شده ساخته و آزموده شد. همان میزان قدرت بازنویسی برای همه موارد به کار رفت. ابزاری که در یک مرورگر اجرا می‌شود همان دسته از ویرایش، یعنی جایگزینی واژه و بازسازمان‌دهی جمله، را انجام می‌دهد. اما مانند یک مقاله پژوهشی، همان نوع کنترل را بر آشکارسازِ طرف دیگر یا بر کیفیت بازنویسی ندارد.

مقاله خود را انسانی‌سازی کنید

متنِ کمک‌گرفته از AI خود را دگرگون کنید و کاری کنید طبیعی به نظر برسد، بدون دست زدن به واژه‌های مهم یا ارجاع‌ها.

رایگان شروع کنید

چرا امتیاز پایین‌تر در یک آشکارساز به دیگری منتقل نمی‌شود

آشکارسازها همان چیز را از همان نقطه مرجع اندازه‌گیری نمی‌کنند. یک متن همراه درباره how AI detectors work سازوکار را به‌طور کامل پوشش می‌دهد، اما نکته مرتبط در اینجا ساده است: هر آشکارساز در برابر مدل مرجع خودش امتیازدهی می‌شود، بنابراین ویرایشی که برای یکی غیرقابل‌پیش‌بینی به نظر می‌رسد، ممکن است برای دیگری همچنان عادی به نظر برسد.

پژوهشگرانی که مجموعه‌ای از آشکارسازهای تجاری و متن‌باز را در برابر ویرایش، بازنویسی، دستوردهی و حملات ترکیبی به‌صورت آزمون فشار بررسی کردند، دریافتند که عملکرد به‌طور میانگین 35 درصد کاهش یافت، اما نه به‌صورت یکنواخت. نتیجه آنان این بود که تقریباً هیچ‌یک از آشکارسازها در برابر همه انواع حمله پایدار نماندند، و هر یک به‌جای یک ضعف مشترک، رخنه‌های متفاوت و مشخص خود را داشتند. یک آزمون واقعی از یک humanizer واحد همین الگو را نشان داد: همان بند بازنویسی‌شده در دو آشکارساز جداگانه 100 درصد AI گرفت، در یک سومی نیز 100 درصد ماند، و در چهارمی به 88 درصد کاهش یافت، و همه این‌ها تنها از یک عبور از یک ابزار حاصل شد.

هزینه بازنویسی تهاجمی چیست

بازاریابی این دسته به‌ندرت از حالت شکست در سوی دیگر یک بازنویسی سنگین یاد می‌کند: ابزاری که به اندازه کافی یک جمله را تغییر می‌دهد تا امتیاز را جابه‌جا کند، می‌تواند آن را به اندازه کافی هم تغییر دهد تا معنا از دست برود. یک رسانه همان بند تولیدشده توسط AI را از میان ده ابزار humanizer مختلف عبور داد و نتایج را با متن منبع سنجید. چند مورد جمله‌هایی تولید کردند که دیگر به‌صورت English قابل تحلیل نبودند. یکی دستور "Tap your Apple ID" را به "Faucet your Apple ID" تبدیل کرد. دیگری "Understanding LinkedIn Premium" را به "Grasping LinkedIn Premium" بدل کرد، که بازبینان اشاره کردند "doesn't convey the same meaning at all." نتیجه کلی آنان این بود که ابزارها "didn't seem to have any sense of the meaning of the article as a whole."

نوشتار دانشگاهی نسبت به چنین شکستی بسیار کم‌گذشت‌تر از یک پست وبلاگی محصول است. وقتی یک واژه احتیاطی با ادعایی قوی‌تر جایگزین می‌شود، "may indicate" به "shows" بازنویسی می‌شود، این تغییر مشخص می‌کند که یک ارجاع دقیقاً برای پشتیبانی از چه چیزی به کار می‌رود، و وقتی جمله‌ای پیرامون یک نقل‌قول بازآرایی می‌شود، ممکن است ارجاع را از ادعایی که در اصل کنار آن قرار داشت جدا کند. یک in-text citation fixer می‌تواند ارجاعی را که از جمله خود جدا شده است دوباره در جای درست بنشاند، بی‌آنکه جزئیاتی را که منبع هرگز پشتیبانی نکرده است جعل کند، اما نمی‌تواند به شما بگوید که آیا خودِ ادعا هنوز با آنچه منبع می‌گوید مطابقت دارد یا نه. در هر صورت، بخشی که ارجاع‌های فراوان دارد ارزش آن را دارد که به‌صورت دستی بررسی شود.

نوع ویرایشاثر معمول بر نمره یک آشکارسازچه چیزی ممکن است خراب شود
جایگزینی واژه‌های منفرد با مترادف‌هااندک، و اغلب در محدوده نویز معمول آشکارسازیک واژه احتیاطی می‌تواند به ادعایی قوی‌تر از آنچه منبع پشتیبانی می‌کند تبدیل شود
بازآرایی یا ادغام جمله‌هابزرگ‌ترین و پایدارترین اثر، این همان چیزی است که burstiness می‌سنجدیک ارجاع ممکن است از ادعایی که در اصل کنار آن قرار داشت جدا شود
بازنویسی کامل یک بخشدر آشکارسازی که ابزار بر اساس آن تنظیم شده بود بزرگ است، و در جاهای دیگر غیرقابل پیش‌بینیبیشترین خطرِ تولید متنی که دیگر اصلا به صورت یک جمله قابل تجزیه نیست
افزودن پرکننده‌هایی مانند غلط‌های تایپی پراکنده یا حاشیه‌پردازی‌هاحداقل تا هیچ، این کار ظاهری است، نه ساختاریبرای خواننده انسانی مصنوعی به نظر می‌رسد، بی‌آنکه الگوی زیرین را اصلاح کند

پس، آیا humanizers هوش مصنوعی کار می‌کنند؟

آنچه شواهد بالا در واقع نشان می‌دهد این است که humanizers به‌طور قابل اعتماد ویژگی‌های آماری‌ای را که یک آشکارساز می‌سنجد تغییر می‌دهند، و این یک اثر واقعی و مکانیکی است، نه تبلیغاتی. با این حال، آنها به‌طور قابل اعتماد تضمین نمی‌کنند که از هر آشکارساز مشخصی عبور کنند، زیرا آشکارسازها بنا به طراحی با یکدیگر اختلاف دارند، و هرچه یک ابزار برای تعقیب آن تضمین با شدت بیشتری بازنویسی کند، احتمال بیشتری دارد که در این میان چیزی از معنا را از دست بدهد.

"Do humanizers work" در واقع سه پرسش است که در قالب یک جمله آمده‌اند: آیا ابزار الگو را تغییر می‌دهد، آیا آن تغییر در برابر آشکارساز مشخصی که برای شما اهمیت دارد باقی می‌ماند، و آیا جمله هنوز همان چیزی را می‌گوید که شما منظور داشتید. پاسخ پرسش نخست، بر پایه شواهد بالا، معمولا بله است. دو مورد دیگر به ابزار، آشکارساز، و میزان شدت اجرای بازنویسی بستگی دارند.

ابزار AI humanizer در TextPulse بر پایه همین مبادله طراحی شده است، نه بر پایه یک وعده. این ابزار یک سند را بازنویسی می‌کند و یک Human Score تخمینی گزارش می‌دهد که از همان نشانه‌هایی محاسبه می‌شود که آشکارسازها از آن‌ها استفاده می‌کنند، از جمله ریتم جمله و پیش‌بینی‌پذیری واژه‌ها، نه این ادعا که هر آشکارساز نام‌برده‌ای آن را خواهد پذیرفت. یک طرح رایگان دقیقاً به این دلیل وجود دارد که بتوانید پیش از آنکه تصمیم بگیرید آیا این مبادله در جدول بالا برای یک سند کامل ارزش دارد یا نه، ببینید یک pass واقعاً چه چیزهایی را، خط به خط، تغییر می‌دهد.

کار کردن و برای استفاده ایمن بودن، دو آزمون جداگانه هستند، و پرسش ایمنی صفحه‌ای مستقل دارد. نسخه دقیق‌تر آن نیز همین‌طور است: اینکه Turnitin هنگام مواجهه با متن humanized چه می‌کند.

ابزارهایی که ارزش اعتماد دارند، آن‌هایی هستند که نشان می‌دهند چه چیزی تغییر کرده است و به شما امکان می‌دهند آن را بررسی کنید، نه آن‌هایی که از شما می‌خواهند به یک درصد در صفحه فرود اعتماد کنید. پیش از آنکه چیزی را ارسال کنید، پاراگراف بازنویسی‌شده را در برابر متن اصلی بخوانید، همان‌گونه که پیش‌نویس نخست یک دستیار پژوهشی را بررسی می‌کنید، زیرا humanizer از نظر کارکردی دقیقاً همین است.

XLinkedInFacebook

سؤالات متداول

آیا AI humanizers به‌قدر کافی قابل‌اعتماد هستند که بتوانند عبور را تضمین کنند؟ هیچ ابزار واحدی نمی‌تواند این را با قطعیت بگوید. Humanizers ساختار جمله و پیش‌بینی‌پذیری واژه‌ها را تغییر می‌دهند، همان سیگنال‌هایی که detectors اندازه‌گیری می‌کنند، بنابراین امتیازها اغلب پایین می‌آیند، اما detectors بنا به طراحی با یکدیگر اختلاف دارند. این‌که آیا تغییر در detector مشخصی که برای شما مهم است پایدار می‌ماند یا نه، پرسشی جداگانه و کم‌پیش‌بینی‌تر از این است که آیا اصلاً تغییری رخ داده است یا نه.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

از تازه‌های انسان‌سازی AI باخبر بمانید

نکات مربوط به نگارش دانشگاهی، تشخیص AI و انسان‌سازی را در صندوق ورودی‌تان دریافت کنید.

بدون اسپم. هر زمان خواستید لغو اشتراک کنید.