多言語AIヒューマナイザー: 1つのエンジン、60以上の言語
TextPulseは60以上の言語にわたって単一のエンジンとして動作しますが、検出器の普及状況、文体規範、引用の慣行は国ごとに異なります。このハブでは、言語固有の人間化がなぜ重要かを説明し、インドネシア語からヒンディー語まで15言語の詳細ガイドへのリンクを示します。
TextPulseは、英語のみのツールでは対応できない問題を解決します。現在、学術著者がChatGPTで数十の言語にわたって執筆しているのが見られます。各言語には、それぞれ独自の検出器の状況、独自の文体レジスターの好み、そして機械が書いたように聞こえる文章を示す独自の手がかりがあります。英語のみのツールでは、ドイツ語における口語化の進行や、フランス語における直訳的表現、あるいは中国語出力を見分ける韻律の平板化に対応できません。多言語対応のAIヒューマナイザーは、それらすべてに対応します。TextPulseは、それらすべてを理解する単一のエンジンを動かしているため、ジャカルタの研究者もソウルの研究者も、英語の社内文体を翻訳したものではなく、自分自身の声として読める文章を得られます。
この投稿は、TextPulseの言語対応の中心です。AI検出とAIらしく聞こえる散文が言語ごとに異なる理由を説明し、専用ガイドで扱う15言語を一覧し、free AI humanizerが、原稿がどの言語で書かれていても、引用、専門用語、文体レジスターをどのように保持するかを述べます。以下にリンクされた各ガイドでは、その言語に固有の検出器の普及状況、大学の方針、引用文化についてさらに詳しく扱います。
AIテキストのヒューマナイズが言語固有である理由
主として英語で訓練された検出器は、スペイン語、アラビア語、タイ語を読むときに異なる振る舞いを示します。盗用検出ツールやAI検出ツールの中には、言語ごとに閾値を再調整するものがあり、大学の方針文書では、プログラムが置かれている国に応じて異なる検出器が名指しされています。AIらしく聞こえる散文もまた、言語固有です。英語のChatGPT出力は定型的な接続表現と均一なリズムの文に依拠しますが、ドイツ語の出力は、セミナー論文には形式的すぎるレジスターへとずれやすく、一方で日本語の出力は、敬語が依拠するレジスターの標識を平板化することがあります。英語の手がかりだけで訓練されたヒューマナイザーは、これらのパターンのいずれも認識できません。なぜなら、それらを探すようには作られていないからです。
一般的な回避策は、英語で書き、その英語を人間らしく整え、その後で対象言語に翻訳することです。しかし、これは実際にはうまくいきません。翻訳によって、機械生成のように読ませる直訳調の表現や硬い言い回しが再び入り込み、途中で技術用語や引用形式の意味がずれることもあります。人間らしさの調整は、英語の下書きを後から翻訳したものに対してではなく、原稿が実際に書かれている言語の中で、その言語固有の文構造と文体規範に働きかける形で行わなければなりません。そのため、TextPulse は、すべてをまず英語に通すのではなく、対応する各言語を直接処理します。
地域別の15の詳細ガイド、60以上の対応言語
以下の各言語には、それぞれ専用のガイドがあり、その言語に特有の検出ツールの普及状況、大学の方針、そして AI による下書きを見分ける手がかりを扱っています。インドネシア語ガイドでは、Bahasa Indonesia の検出が東南アジアの大学でどのように広がっているかを検討し、ドイツ語の解説では、論文が機械作成と判定される手がかりとなる Sie と du の文体のずれを扱っています。スペイン語ガイドは usted と tú の切り替わりを扱い、ロシア語ガイドは Antiplagiat が AI 生成テキストをどのように読むかを扱い、韓国語ガイドは ChatGPT による下書きを見分ける敬語の誤用を説明しています。日本語ガイドとタイ語ガイドが東アジアと東南アジアの解説を補完しており、それぞれが母語の例を中心に構成されています。
ヨーロッパ
🇩🇪 ドイツ語 · 🇫🇷 フランス語 · 🇷🇺 ロシア語 · 🇹🇷 トルコ語 · 🇮🇹 イタリア語 · 🇵🇱 ポーランド語 · 🇺🇦 ウクライナ語 · 🇷🇴 ルーマニア語 · 🇬🇷 ギリシャ語 · 🇨🇿 チェコ語 · 🇭🇺 ハンガリー語 · 🇳🇱 オランダ語 · 🇸🇪 スウェーデン語 · 🇩🇰 デンマーク語 · 🇳🇴 ノルウェー語 · 🇫🇮 フィンランド語 · 🇧🇬 ブルガリア語 · 🇸🇰 スロバキア語 · 🇷🇸 セルビア語 · 🇭🇷 クロアチア語 · 🇸🇮 スロベニア語 · 🇱🇹 リトアニア語 · 🇱🇻 ラトビア語 · 🇪🇪 エストニア語 · 🇦🇱 アルバニア語
ラテンアメリカとイベリア
東アジア
東南アジア
🇮🇩 インドネシア語 · 🇻🇳 ベトナム語 · 🇹🇭 タイ語 · 🇲🇾 マレー語 · 🇵🇭 フィリピン語 · 🇲🇲 ビルマ語 · 🇰🇭 クメール語 · 🇱🇦 ラオ語
南アジア
🇮🇳 ヒンディー語 · 🇧🇩 ベンガル語 · 🇵🇰 ウルドゥー語 · 🇮🇳 タミル語 · 🇮🇳 テルグ語 · 🇮🇳 マラーティー語 · 🇮🇳 パンジャーブ語 · 🇳🇵 ネパール語 · 🇱🇰 シンハラ語
中東と中央アジア
🇸🇦 アラビア語 · 🇮🇷 ペルシア語 · 🇮🇱 ヘブライ語 · 🇦🇿 アゼルバイジャン語 · 🇰🇿 カザフ語 · 🇺🇿 ウズベク語 · 🇦🇲 アルメニア語 · 🇬🇪 ジョージア語 · 🇦🇫 パシュトー語
アフリカ
🇰🇪 スワヒリ語 · 🇪🇹 アムハラ語 · 🇳🇬 ハウサ語 · 🇳🇬 ヨルバ語 · 🇳🇬 イボ語 · 🇿🇦 ズールー語 · 🇿🇦 アフリカーンス語 · 🇸🇴 ソマリ語
残りのガイドは、それぞれ独自の検出環境を持つ言語を扱っている。French guideは、翻訳調に聞こえる段落を見分けさせる直訳的な表現を説明し、Arabic guideは、Modern Standard Arabic の学術文書における形式的レジスターのずれを扱っている。Turkish guideとPersian guideはどちらも、英語で訓練された検出器が見落としがちな膠着的な構造と形式的レジスターの兆候を扱う。一方で、Vietnamese guideとPortuguese guideは、ブラジルとヨーロッパの学術慣行を、東南アジアのそれとは別に扱っている。Chinese guideは北京語の文のリズムを扱い、Hindi guideは、インドの大学での執筆に一般的な Hindi-English のコードスイッチングのパターンを扱っている。
自分の論文を人間らしくする
重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。
多言語 AI humanizer があらゆる言語で自然さを保つ方法
まず重要なのは、レジスターの一貫性である。学術用途向けに作られた humanizer は、スペイン語の学位論文がスペイン語のブログ記事とは異なる読み方をされること、ドイツ語のゼミ論文では文書全体を通して正式な Sie の呼称が維持されること、そして日本語の博士論文では話し言葉の敬語とは異なる書き言葉のレジスターが用いられることを理解していなければならない。TextPulse は、レジスターが文ごとにずれていくのではなく、原稿全体を通してそれを安定させるが、これは査読者が探す最も明確な兆候の一つである。引用は、APA、GB/T 7714、または特定分野で一般的な雑誌固有のスタイルのいずれであっても、書かれたとおりにそのまま通過し、書き換えによって参考文献一覧に触れることはない。
専門用語、固有名詞、数値はそのまま通過する。なぜなら、化学名や統計値を書き換える humanizer は、指導教員が即座に見抜く誤りを生むからである。同じ書き換えの論理は、対応するすべての言語の下で動作しており、それぞれの言語の文体と detector の状況に合わせて個別に調整されている。これにより、単一の多言語 AI humanizer が実用的になり、十五個の別々のツールを動かす必要がなくなる。新しい detector と新しい学術規範が現れるにつれて対応範囲は拡大し続けるが、方法は同じである。実際に原稿が書かれた言語で直接作業することである。
English と自分の言語のあいだで作業する
多くの研究者は、学術誌向けには English で、学位論文や国内向け媒体向けには第一言語で下書きを作成する。この二つの作業手順は、異なる側面から同じ問題に向き合っている。AI で下書きされた English の原稿には detector が English で探す痕跡が含まれ、Korean や Spanish の論文章にはその言語固有の痕跡が含まれる。翻訳してうまくいくことを期待するのではなく、書かれた言語のまま各テキストを humanize することで、論旨と文体を保つことができる。
実務上の規則は単純である。提出する版を、提出する言語で humanize し、所属機関が実際に使用している detector と照合して結果を確認する。上にリンクされた言語別ガイドでは、Europe と Southeast Asia における Turnitin の到達範囲から、Russia, Korea and China で使われている地域のツールまで、各学術文化における detector の状況がどのようなものかを説明している。
よくある質問
はい。TextPulseは60以上の言語にわたって多言語AIヒューマナイザーとして動作し、そのうち15言語は検出器の普及状況と大学の方針に関する専用研究で扱われています。書き換えのロジックは、英語の規則をどこにでも適用するのではなく、各言語の文体と引用の慣習に適応します。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.