Turnitinのスコアとして良いのはどの程度か?
Turnitinは許容される類似性の割合を公表しておらず、代わりに各機関が独自の指針を定めています。本稿では、実際に高いスコアや低いスコアを左右する要因、引用文や参考文献一覧が問題がなくても数値を押し上げる理由、そして数値そのものではなく、その背後にある一致の内訳をどのように読むかを説明します。
ある学生は、指導教員から、15パーセント未満なら問題ないと言われる。別の学生も同じ学科にいるが、彼の論文は、廊下の向こうで12パーセントと判定され、そのうち3ポイントは、引用符のない一続きの段落に収まっていたために指摘された。どちらも Turnitin の類似度スコアを正しく読んでいる。このツールは、そもそも合否を示す単一の数値を出すために作られたものではない。
では、良い Turnitin スコアとは何か。そのような数値は存在しない。Turnitin は許容される割合を公表しておらず、提出物に採点を行うこともなく、この数値はそれ自体では盗用の指標ではないと明言している。各機関が独自の指針を定めており、しばしばその内部の各指導教員も同様であるため、同じ報告書でも、ある部署では特に問題なく見え、次の部署では懸念材料に見えることがある。学ぶ価値があるのは、その数値の背後にあるものをどう読むかである。
良い Turnitin スコアとは何か
Turnitin は、良い、安全、または許容できるとみなされる数値をこれまで公表したことがない。その理由は明確である。類似度スコアは、提出物の中のどれだけの文章が、すでに Turnitin のデータベース内にある文章と一致するかを測るのであって、その重なりが不適切に用いられたかどうかを測るものではない。高いスコアは、引用され、正しく出典が示された資料だけから成ることもある。低いスコアでも、ある一つの出典をかなり忠実に言い換えた論文が、査読者に問題を生じさせるほどの内容でありながら、照合エンジンにはまったく引っかからないことがある。数値を成績として読むのは、このツールの理解を逆にしている。
10パーセントから20パーセントのような数値は、経験則として広く流通しており、掲示板や学習ガイドで繰り返されるうちに、公式のように聞こえ始める。しかし、それは公式ではない。Turnitin はそのような数値を定めておらず、文書の長さ、引用の密度、分野ごとの慣例を無視した経験則は、実際の論文に当たった瞬間に破綻する。30の適切に引用された出典から成る文献レビューは、引用だけで20パーセントを超えることがある。引用符のない、1つの密接に言い換えられた段落は、5パーセント未満に収まっていても、なおより深刻な問題であることがある。
類似度スコアが実際に測定しているもの
Turnitinは、自社のツールをほぼまったく同じ用語で説明している。Boise State Universityによる案内は、Turnitin自身の表現に基づき、類似度スコアとは、論文の内容のうちTurnitinのデータベースにすでにある資料と一致する割合であり、その割合自体は、その論文に盗用された資料が含まれているかどうかの評価ではないと説明している。この区別は実際に重要である。一致とは機械的なものであり、ある語列がどこか別の場所の語列と並ぶことであるが、その重なりが適切に出典表示されているかを判断するには、アルゴリズムではなく人間が必要である。
一致の背後にあるデータベースは、意図的に広く設定されている。現在および過去の学生提出物、オープンウェブ、そして大量の学術出版物である。そうした内容は、いずれも意味を読まれるわけではない。システムは重なっている語列を見つけ、提出物のどの程度をそれらが覆っているかを報告する。そのため、引用された一文と、黙ってコピーされた一文は、同一の一致を生みうる。どちらであるかは、報告書の詳細表示でのみ分かる。
なぜ高いスコアが完全に正当でありうるのか
その大半は、学術的文章の二つの通常の特徴で説明できる。引用箇所は、意図的に語がコピーされ、紙面上で他者のものとして示されるため、設計上一致する。参考文献一覧も同様に確実に一致する。著者名、雑誌名、引用形式は、同じ出典を引用する何千もの他の論文にわたって繰り返されるからである。どちらも、正しい学術的文章が本来示すべき姿である。
並べてみると、過大なスコアと実際の問題は、一見して異なって見える。
| 何が一致したか | なぜそれが起きたか | より詳しく確認する価値があるか |
|---|---|---|
| 引用符と出典を伴う引用箇所 | その語句は意図的に複写され、ページ上で出典が示されていた | いいえ、これは正しい引用の見え方である |
| 参考文献一覧または文献目録 | 著者名、雑誌名、引用形式は、多くの他の論文にわたって繰り返される | いいえ、除外設定が適用されていなかった場合を除く |
| 標準的な方法記述または手順上の言い回し | ある分野で共有される語彙は、同じ手順を論文間で同じように記述する | まれに、節全体が新たに書かれたのではなく、そのまま持ち込まれている場合を除く |
| 引用符のない、1つの出典に一致する、長く途切れない段落 | その表現は、他の著者の文にかなり近く追随しており、一致検出エンジンが検出する | はい、これは出典を開いて確認する価値があるパターンである |
自分の論文を人間らしくする
重要な語句や引用には手を加えずに、AI支援テキストを変換して自然な人間の文章のようにします。
低いスコアでも問題を隠していることがある理由
低い数値が答えているのは、見た目よりも狭い問いである。つまり、少量のテキストが Turnitin のデータベースと一語一句一致するかどうか、それだけである。他の著者の構成や論旨を保ちながら、語句だけを十分に言い換えたパラフレーズは、ほぼゼロに近いスコアになっても、依然として重大な研究倫理上の問題になりうる。なぜなら、このエンジンは借用された発想ではなく、語の連なりを基準に動作するからである。翻訳された内容、または Turnitin の索引化されたデータベースの外部にある資料も、同じように振る舞う。照合対象がなければ、何もフラグは立たない。
捏造された出典は、別の方向から同じ盲点を生み出す。存在しない参考文献は、どこにも照合先がないため、何とも一致しえない。また、そもそも実在しなかった引用を、類似度スコアがフラグ付けする方法もない。TextPulse の free AI citation checker は、まさにその欠落に対応するためにある。読者がその不備を後から見つける前に、参考文献一覧の各項目を、それらの出典が実際に現れるべき実在の登録情報と照合する。
数値そのものを離れる前に、もう一つ区別しておく価値がある。類似度スコアが低い提出物であっても、Turnitin の別個の AI writing indicator をなお含みうる。これは別の種類の問題を検出するために作られた、別の測定であり、このサイトのTurnitin が実際に ChatGPT を検出できるかどうかに関するガイドで扱っている。二つの百分率は同じ方法では計算されず、ここで扱うのは類似度スコアのみである。
数値ではなくレポートの読み方
一致の内訳を開く前に、合計値だけで反応してはならない。Turnitin は、スコアを構成する人のソースを、その寄与の大きい順に並べる。11 のソースがそれぞれ 2 パーセントずつ寄与して合計 22 パーセントになる場合と、1 つのソースだけで合計 22 パーセントになる場合とでは、受け取り方が異なる。前者のパターンは、多くの一般的な語句にわたる重なりを反映していることが多い。後者は、そのソースが実際に何を述べているのかを直接確認する価値がある。
Turnitin はまた、同じ百分率を色帯に分類する。これは Loughborough College の学生向け案内にも示されている。すなわち、青は一致するテキストなし、緑は 1 語から 24 パーセント、黄は 25 から 49、橙は 50 から 74、赤は 75 以上である。同大学の案内は、色が何を意味しないかについても明確である。類似性チェックは、提出物に盗用された資料が含まれていることを意味しない。色はレポートを注意喚起のために分類するのであって、判定ではない。
機関独自の設定で引用と参考文献一覧を集計から除外するかどうかも確認する価値がある。同じ提出物でも、その切り替え設定によって二つの異なる数値が出ることがあるからである。これらは、見えるようになれば複雑ではない。レポートを最初のページの先まで開く者がいなければ、見えないだけである。
スコアが意外だった場合にすべきこと
各フラグ付きソースは、合計値に反応するのではなく、個別に再度開いてください。採点対象の版において、引用と参考文献が除外されているかを確認してください。下書き中に学生が見る数値は、提出時に教員が見る数値と必ずしも同じ設定ではないためです。真に出典のない一致が見つかった場合は、照合エンジンをすり抜けるために文を言い換えるのではなく、引用を直接修正してください。後者は症状を処理するだけで、問題自体は残ります。
それでも数値が指導教員の想定とずれているように感じられる場合は、その学部独自の慣例が何かを直接尋ねてください。上の各節で、達成すべき単一の基準線は存在しないことはすでに示されています。したがって、答えは事前に誰でも調べられた割合ではなく、その課題について現地の権限を持つ人にあります。TextPulseのfree tools collectionには、レポートが他者の受信箱に届く前に実行する価値のある引用確認と下書き確認が含まれています。
異なるツールのスコアは互換的ではなく、how GPTZero worksは、その下にあるperplexity統計量とともに、別ページで説明されています。
そのスコアがそのように振る舞うのは、その下で行われる照合の仕組みによるものであり、同じレポート上でその横に今では表示される新しい数値は、別の機構で動作します。このサイトのhow AI detectors actually workに関するガイドが、その全体を詳しく示しています。どちらの数値も判定として読むことは、レポートのうち読む価値のある唯一の部分を飛ばすことになります。
よくある質問
Turnitinのスコアとして良いのはどの程度か? そのような数値はありません。Turnitinは許容される割合を公表しておらず、類似性スコアは盗用された量ではなく、そのデータベースとどれだけの文字列が一致したかを示します。適切に引用された文献レビューは、引用だけで20パーセントを超えることがありますが、出典のない言い換えが1つあるだけで5パーセント未満にとどまることもあります。見出しの数値ではなく、一致した出典を読んでください。
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.