AI Detection

良いTurnitinスコアとは何か

Turnitinは許容される類似率を公表しておらず、各機関が独自の指針を定めています。本稿では、実際に高いスコアや低いスコアを左右する要因、引用箇所や参考文献一覧が問題がなくても数値を押し上げる理由、そして数値そのものではなく、その背後にある一致の内訳をどのように読むかを説明します。

最終更新日 6 min
What is a good Turnitin score? A similarity report broken into matched sources rather than one number.

ある学生は、指導教員から、15パーセント未満なら問題ないと言われる。別の学生も同じ学科にいるが、彼の論文は廊下の向こうで12パーセントとしてフラグが立てられ、そのうち3ポイントは、引用符が近くにない、1つの切れ目のない段落に収まっていた。どちらも Turnitin の 類似度スコア を正しく読んでいる。このツールは、そもそも単一の合否数値を示すために作られたものではない。

では、良い Turnitin スコアとは何か。そうした数値は存在しない。Turnitin は許容される割合を公表しておらず、提出物を採点もしないし、この数値はそれ自体では剽窃の尺度ではないと明言している。各機関が独自の指針を定めており、しばしばその内部の各指導教員も同様であるため、同じ報告書でも、ある部署では特に問題なく見え、次の部署では懸念材料に見えることがある。学ぶ価値があるのは、その背後にあるものの読み方である。

Turnitin similarity report showing 12% overall similarity with match groups for uncited matches and missing quotations, and top sources split across internet, publications and student papers
12% の類似度報告書を一致グループに分けたもの, 重要なのは見出しの数値ではなく, そのうちどれだけが出典のない一致テキストで, どれだけが引用済みかつ参照済みの資料であるかである。

良い Turnitin スコアとは何か

Turnitin は、良い, 安全, または許容できるとみなされる数値を公表したことがない。その理由は明確である。類似度スコアは、提出物の中のどれだけのテキストが Turnitin のデータベース内に既にあるテキストと一致するかを測るのであって、その重複が不適切に用いられたかどうかを測るのではない。高いスコアは、引用され、正しく出典が示された資料だけから成ることもある。低いスコアでも、1つの出典をかなり近くに言い換えていて、採点者に問題を生じさせる論文の上に位置することがあり、その場合、照合エンジンはまったく反応しない。数値を成績として読むことは、このツールの理解を逆にしてしまう。

十から二十パーセントのような数値は、経験則として広く流通しており、フォーラムや学習ガイドで繰り返されるうちに、あたかも公式のように聞こえ始める。しかし、それは公式ではない。Turnitin はそのような数値を設定しておらず、文書の長さ、引用密度、分野ごとの慣行を無視する経験則は、実際の論文に当たった瞬間に破綻する。三十の適切に引用された資料から成る文献レビューは、引用だけで二十パーセントを超えることがある。引用符のない、かなり言い換えられた一つの段落は、五パーセント未満に収まっていても、より深刻な問題である可能性がある。

類似度スコアが実際に測定しているもの

Turnitin は自社のツールを、ほぼまさにそのような言葉で説明している。Boise State University の指針は、Turnitin 自身の表現に基づき、類似度スコアとは、論文の内容のうち Turnitin のデータベースに既にある資料と一致する部分の割合であり、その割合自体は、その論文に盗用された資料が含まれているかどうかの評価ではないと説明している。この区別は実際に重要である。一致は機械的なものであり、ある語列がどこか別の場所の語列と並ぶことにすぎないが、その重なりが適切に出典表示されていたかを判断するには、アルゴリズムではなく人間が必要である。

一致の背後にあるデータベースは、意図的に広範である。現在および過去の学生提出物、オープンウェブ、そして大量の学術出版物が含まれる。これらの内容はいずれも意味として読まれるわけではない。システムは重なっている語列を見つけ、提出物のどの程度をそれらが覆っているかを報告する。そのため、引用された一文と、黙って複製された一文は、同一の一致を生みうる。どちらであるかを示すのは、報告書の詳細表示だけである。

高いスコアが完全に正当でありうる理由

学術的文章の通常の二つの特徴が、その大半を説明する。引用された箇所は、意図的に語が複製され、紙面上で他者のものとして示されるため、設計上一致する。参考文献一覧も同様に確実に一致する。著者名、雑誌名、引用形式は、同じ資料を引用する他の何千もの論文の間で繰り返されるからである。どちらも、正しい学術的文章が本来示すべき姿である。

並べて見ると、膨らんだスコアと実際の問題は、一見すると異なって見える。

一致したものそれが起こった理由より詳しく確認する価値があるか
引用符と出典を伴う引用箇所その語句は意図的に複写され、ページ上で出典が示されていたいいえ、これは正しい引用の見え方である
参考文献一覧または書誌著者名、雑誌名、引用形式は、多くの他の論文にわたって繰り返されるいいえ、除外設定が適用されていない場合を除く
標準的な方法記述または手順的な言い回しある分野で共有される語彙は、同じ手順を論文間で同じように記述するまれであるが、全体の節が新たに書かれたのではなく、そのまま持ち込まれている場合は別である
引用符のない、1つの出典に一致する長く途切れない段落その表現は、他の著者の文に十分近く、照合エンジンが検出するはい、これは出典を開いて確認する価値のあるパターンである

自分の論文を人間らしくする

重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。

無料で始める

低いスコアでも問題を隠していることがある理由

低い数値が答えているのは、見た目よりも狭い問いである。つまり、少量のテキストが Turnitin のデータベースと語句単位で一致するかどうか、それだけである。他の著者の構成や論旨を保ちながら語句を十分に言い換えたパラフレーズは、0に近いスコアになることがあり、それでも重大な研究倫理上の問題でありうる。なぜなら、このエンジンは借用されたアイデアではなく、語の並びに基づいて動作するからである。翻訳された内容、または Turnitin の索引化されたデータベースの外部にある資料も同じように振る舞う。照合するものがなければ、フラグも立たない。

捏造された出典は、別の方向から同じ盲点を生み出す。存在しない参考文献は何とも一致しえない。どこにも照合先がないからであり、類似度スコアには、そもそも実在しなかった引用を示す方法がない。TextPulseの無料AI引用チェッカーは、まさにその欠落に対応するために存在する。読者がその欠落を苦労して見つける前に、参考文献一覧の各項目を、それらの出典が本来掲載されるべき実際の登録情報と照合するのである。

数値そのものに進む前に、もう一つ区別しておく価値がある。類似度スコアが低い提出物であっても、Turnitinの別個のAI執筆指標を含みうる。これは別の種類の問題を捉えるために作られた、別の測定であり、このサイトのTurnitinが実際にChatGPTを検出できるかどうかに関するガイドで扱っている。二つの割合は同じ方法では算出されず、この文章は類似度スコアのみを扱う。

数値ではなくレポートの読み方

一致の内訳を開く前に、合計に反応してはならない。Turnitinは、スコアを構成する個々の出典を、その寄与度の順に並べる。11の出典がそれぞれ2パーセントずつ寄与して合計22パーセントになる場合と、1つの出典だけでその合計になる場合とでは、同じ合計には見えない。前者のパターンは、多くの一般的な表現にわたる重複を反映していることが多い。後者は、その出典が実際に何を述べているのかを直接確認する価値がある。

Turnitinは同じ割合を色帯にも分類し、これはLoughborough Collegeの学生向け案内にもそのまま示されている。青は一致するテキストなし、緑は1語から24パーセント、黄は25から49、橙は50から74、赤は75以上である。同大学の案内は、色が何を意味しないかについても明確である。類似性チェックは、提出物に盗用された資料が含まれていることを意味しない。色はレポートを注意のために分類するのであって、判定ではない。

機関独自の設定で引用と参考文献がカウントから除外されるかどうかも確認する価値がある。というのも、同じ提出物でも、その切り替え設定によって2つの異なる数値が出ることがあるからである。これらの点は、いったん見えるようになれば複雑ではない。報告書の最初のページの先まで誰も開かない場合にのみ、見えないままである。

スコアが予想外だった場合にすべきこと

合計値に反応するのではなく、警告された各ソースを個別に再度開くこと。採点対象の版で引用と参考文献が除外されているかを確認すること。というのも、学生が下書き中に見る数値と、教員が提出時に見る数値は、必ずしも同じように設定されているとは限らないからである。実際に出典のない一致が見つかった場合は、文を言い換えて照合エンジンをすり抜けようとするのではなく、引用を直接修正すること。その方法は症状に対処するだけで、問題自体は残る。

それでも数値が指導教員の想定と合わないと感じるなら、その学部独自の慣例が何かを直接尋ねること。上の各節ですでに示したように、到達すべき単一の基準線は存在しない。したがって答えは、事前に誰でも調べられたはずの割合ではなく、その課題について現場で権限を持つ誰かにある。TextPulseの無料ツール集には、報告書が他人の受信箱に届く前に実行する価値のある引用と下書きの確認が含まれている。

異なるツールのスコアは互換的ではなく、GPTZeroの仕組みは、それ自体のページで説明されている。また、その両方の下にあるperplexity統計も同様である。

そのスコアがそのように振る舞うのは、その下で行われる照合の仕組みによるものであり、同じ報告書の中でその横に表示される新しい数値は別の機構で動作する。このサイトのAI検出器が実際にどのように機能するかについてのガイドが、その全体を詳しく示している。どちらの数値も判定として読むことは、報告書の中で読む価値のある唯一の部分を飛ばすことになる。

XLinkedInFacebook

よくある質問

良いTurnitinスコアとは何か。そのような数値はありません。Turnitinは許容される割合を公表しておらず、類似性スコアはどれだけの文章がそのデータベースと一致したかを示すのであって、どれだけ盗用されたかを示すものではありません。適切に引用された文献レビューでは、引用だけで20%以上になることがありますが、出典のない言い換えが1つあるだけで5%未満に収まることもあります。見出しの数値ではなく、一致した出典を読みなさい。

Moe

PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.

AI人間化の最新情報を受け取る

学術ライティング、AI検出、そして人間化に関するヒントを、受信箱へお届けします。

スパムはありません。いつでも配信停止できます。