Cum funcționează GPTZero
GPTZero a făcut celebre perplexity și burstiness, apoi le-a retras discret pe ambele. Iată ce măsoară acum clasificatorul său, ce arată de fapt un raport și unde spune instrumentul că se află propriile sale limite.
Tastați "how gptzero works" într-o bară de căutare și cea mai mare parte a rezultatelor încă descrie perplexity și burstiness, cele două statistici pe care chiar fondatorul său le-a făcut celebre în primele săptămâni după lansarea ChatGPT. Această descriere era corectă în ianuarie 2023. Nu a mai fost corectă din toamna acelui an, când documentația GPTZero însăși spune că firma a înlocuit acea metodă cu ceva cu totul diferit. Diferența dintre ceea ce făcea instrumentul la lansare și ceea ce face acum este suficient de mare încât majoritatea explicațiilor care circulă și astăzi descriu un produs care nu mai există.
Astăzi, GPTZero rulează un clasificator propoziție cu propoziție peste un corpus mare și mixt de texte generate de oameni și texte generate de AI, mai degrabă decât un calcul al perplexity. GPTZero de astăzi oferă în continuare un singur număr principal, dar aritmetica este diferită. Evidențierea la nivel de propoziție de sub numărul principal are, de asemenea, un alt sens decât avea în 2023. Ambele versiuni ale poveștii merită cunoscute, cea care a făcut celebri termenii și cea care rulează efectiv astăzi.
Istoria: cum au făcut perplexity și burstiness GPTZero celebru
La 2 ianuarie 2023, Edward Tian, pe atunci student la Princeton, a lansat o demonstrație publică a GPTZero, la doar câteva săptămâni după apariția ChatGPT. Pagina sa originală de explicații descrie cum a folosit două statistici împrumutate din modelarea limbajului pentru a detecta când un model de limbaj a scris ceva. Perplexity este un scor care arată cât de surprins a fost un model de referință de alegerile de cuvinte din text. Burstiness este denumirea dată de GPTZero pentru cât de mult a fluctuat această surpriză de-a lungul unui document. Aceste pagini de explicații sunt motivul pentru care ambele cuvinte au intrat deloc în conversația de zi cu zi despre scrierea cu AI. Majoritatea oamenilor care pot defini astăzi perplexity sau burstiness au învățat termenii de la GPTZero, nu dintr-un manual.
Mecanismul în sine era simplu de descris. Introduceți un pasaj printr-un model de limbaj de referință, iar proza pe care modelul o consideră foarte previzibilă, cu perplexitate scăzută, este percepută ca tipică pentru mașină, deoarece generarea tinde să favorizeze cuvântul următor probabil în locul celui surprinzător. Chiar și documentația retrasă a GPTZero a publicat o regulă empirică: un scor de perplexitate peste 85 era considerat mai probabil uman decât generat de mașină. Acest prag provenea de la un singur furnizor, pe un singur model, la un anumit moment în timp, iar GPTZero însuși nu îl mai susține.
Cum funcționează acum GPTZero: un clasificator la nivel de propoziție
centrul de asistență al GPTZero afirmă în mod explicit că firma a încetat să folosească perplexitatea și burstiness pentru detectare începând din toamna anului 2023, după migrarea la o arhitectură de deep learning. Pagina sa actuală de tehnologie, verificată pentru acest material, confirmă că schimbarea este totală: ea descrie o abordare end-to-end de deep learning, antrenată pe text din web, educație și o gamă de modele de limbaj, care rulează un model de clasificare propoziție cu propoziție ce produce o probabilitate și un scor de încredere. Perplexity și burstiness nu apar nicăieri pe acea pagină.
De atunci, a adăugat și un strat de apărare, un Paraphraser Shield, conceput pentru a detecta text AI care a fost trecut printr-un instrument de rescriere pentru a evita detectarea. Puteți lipi text, încărca documente Word, PDF-uri și fișiere imagine, precum și până la cincizeci de fișiere simultan. Niciuna dintre aceste componente de infrastructură nu are vreo legătură cu numărarea frecvenței cu care un model de referință ar fi ghicit același cuvânt.
Umanizează-ți propria lucrare
Transformă textul tău asistat de AI și fă-l să sune uman, fără a atinge cuvintele importante sau citările.
Ce vă arată de fapt un raport GPTZero
Un rezultat GPTZero conține trei părți: o clasificare AI, uman sau mixt, un procent care exprimă probabilitatea modelului că documentul a fost scris de AI și o etichetă de încredere care descrie cât de fiabilă este acea predicție anume. Eticheta contează mai mult decât ar putea părea. GPTZero asociază „foarte sigur” cu o rată de eroare sub 2 percent și „încredere scăzută” cu o rată de eroare de 14 percent sau mai mare, un interval suficient de larg încât același procent din titlu poate avea o greutate foarte diferită de la un raport la altul.
Scanările plătite adaugă evidențiere la nivel de propoziție, iar aceasta trebuie citită corect. GPTZero descrie propozițiile evidențiate ca fiind cele care influențează disproporționat scorul general, nu ca o listă de acuzații împotriva unor rânduri individuale. O propoziție poate să nu fie evidențiată și totuși să fi modelat rezultatul, deoarece clasificatorul citește documentul ca întreg, nu votează propoziție cu propoziție.
| Element al raportului | Ce vă spune |
|---|---|
| Clasificare | O singură etichetă: AI, uman sau mixt |
| Scorul de probabilitate AI | Un procent care reflectă cât de probabil consideră modelul că documentul a fost scris de AI |
| Etichetă de încredere | Variază de la foarte sigur, sub o rată de eroare de 2 percent, până la încredere scăzută, 14 percent sau mai mare |
| Evidențierea propozițiilor | Marchează propozițiile care contribuie cel mai mult la scor în Advanced Scan, nu fiecare propoziție conectată la acesta |
Niciunul dintre aceste elemente ale raportului nu exista în forma lor actuală când explicația despre perplexity și burstiness era încă descrierea publică a lui GPTZero despre sine. Interfața s-a schimbat odată cu metoda.
De ce descrierea despre Perplexity și Burstiness continuă să circule
Explicația originală a lui GPTZero este încă online, încă indexată și încă una dintre descrierile generale mai clare ale modului în care funcționează perplexity și burstiness ca noțiuni. Motoarele de căutare și alte site-uri continuă să o citeze, iar unele fac trimitere la o recenzie din 2026, larg distribuită, care susține că instrumentul rulează încă în tăcere un strat de perplexity și burstiness alături de clasificatorul său. Pagini actuale ale lui GPTZero, pagina de tehnologie și ambele articole de suport, spun contrariul, termenii au fost retrași, nu doar ascunși în culise. O pagină care descrie un concept în mod abstract nu este același lucru cu o pagină care descrie metoda actuală a acestui instrument, iar tratarea celor două ca fiind interschimbabile este în mare măsură motivul pentru care confuzia a persistat trei ani după data ei de expirare.
Aceasta contează dincolo de un simplu detaliu. Un student sau un coleg căruia i se spune să reducă perplexitatea sau să distribuie mai uniform lungimea propozițiilor, în mod specific pentru a învinge GPTZero, primește un sfat orientat către o versiune a produsului care a încetat să mai funcționeze în 2023. Ceea ce pune în mișcare un clasificator de propoziții este o întrebare înrudită, dar diferită, mai apropiată de prezentarea generală a modului în care funcționează de fapt detectoarele AI decât de oricare dintre aceste statistici luate separat. GPTZero nu a încetat să le măsoare, după propria sa descriere ele se află printre cei șapte indicatori care alimentează modelul actual, dar au încetat să mai fie elementul care decide răspunsul.
Ce spune GPTZero că nu poate face
Procentele de acuratețe declarate de GPTZero sunt aproximativ la fel de solide pe cât este probabil să publice un furnizor despre propriul produs: 96.5 percent acuratețe pe documente mixte, o rată totală a falselor pozitive pe care compania o plafonează la 1 percent și 1.1 percent în mod specific pentru eseuri TOEFL, un substitut frecvent pentru scrierea în limba engleză a vorbitorilor non-nativi. Aceste cifre provin din propria evaluare a GPTZero, fără nicio replicare independentă citată pe pagina care le raportează.
Pagina proprie a GPTZero despre limitări este mai specifică decât cifrele de marketing. Compania afirmă că acuratețea crește pe măsură ce este trimis mai mult text și scade la nivel de propoziție și paragraf, comparativ cu documentul integral. Afirma că datele sale de antrenare sunt în mare parte proză în limba engleză pentru adulți, astfel încât textul care se abate de la acest tipar este mai greu de clasificat în mod fiabil. Afirma că clasificatorul nu este antrenat să detecteze text AI care a fost modificat substanțial după generare. Și afirmă explicit că și alte texte generate de mașini sau scrieri foarte procedurale, nu doar conținutul produs de chatbot, pot fi semnalate în același mod.
Nimic din toate acestea nu este un motiv pentru a trata numărul GPTZero ca fiind dincolo de orice îndoială, și nu este singurul detector care merită înțeles în propriii săi termeni. Cititorii curioși să vadă singuri la ce răspunde de fapt un clasificator de acest tip pot observa o versiune a acestui tipar cu un verificator gratuit de perplexitate sau cu un verificator gratuit de burstiness, două componente ale unei colecții gratuite de instrumente mai ample, care acoperă celelalte straturi statistice pe care se bazează un raport de acest fel.
Cele două statistici principale ale GPTZero au pagini proprii: ce măsoară perplexity în detectarea AI, și aritmetica probabilității tokenilor care produce ambele numere.
Un instrument dispus să își numească atât de precis propriile puncte oarbe merită mai multă încredere decât unul care nu recunoaște niciunul, iar următorul procent neexplicat dintr-un raport este un loc bun pentru a începe să întrebi ce fel de instrument l-a produs.
Întrebări frecvente
Nu. Centrul de asistență GPTZero afirmă că firma a încetat să folosească perplexity și burstiness pentru detectare începând din toamna anului 2023, după trecerea la un clasificator de deep learning. Pagina sa actuală despre tehnologie descrie un model de clasificare propoziție cu propoziție și nu menționează niciunul dintre cei doi termeni. Această descriere continuă să circule deoarece propriul ghid GPTZero din 2023 a popularizat ambele cuvinte înainte ca metoda să se schimbe.
PhD in natural language processing, with years spent building NLP applications end to end. Moe works on text analysis: lexical and syntactic structure, and what separates machine-generated prose from human prose statistically. He has been experimenting with computational linguistics since the early days of NLTK, spaCy and WordNet, and still writes most of his tooling in Python.