Academic Writing

Czy ChatGPT zmyśla odniesienia? Co wykazały badania nad fabrykacją

Sześć badań, cztery dziedziny, trzy lata. Odsetek, z jakim ChatGPT wymyśla odniesienie, waha się od jednocyfrowych wartości do ponad połowy, a liczba ta nic nie znaczy bez wersji modelu i daty, do której się odnosi.

6 min
Does ChatGPT make up references: a table of studies by model version and year

W czerwcu 2025 roku badacze z Deakin University poprosili GPT-4o o napisanie sześciu przeglądów literatury na tematy związane ze zdrowiem psychicznym. Spośród 176 cytowań, które wygenerował, 35 w ogóle nie istniało. Kolejne 64 wskazywały na rzeczywiste artykuły, ale z błędnie przypisanymi szczegółami. To jedna na pięć referencji całkowicie zmyślona, pochodząca z modelu wydanego ponad rok po tym, jak problem cytowań w ChatGPT został po raz pierwszy zmierzony w druku.

Czy ChatGPT zmyśla referencje? Tak, i nadal robi to w 2026 roku, w aktualnych modelach, nie tylko w wersji, która trafiła na nagłówki w 2023 roku. Otwarte pytanie nigdy nie brzmiało, czy to się zdarza. Chodzi o to, jak często, a ta liczba zmienia się wraz z modelem, wersją, dziedziną i datą przeprowadzenia testu.

Czy ChatGPT Zmyśla Referencje?

Tak. Model językowy przewiduje następne prawdopodobne słowo na podstawie wszystkiego, co je poprzedza. Nie sprawdza niczego, chyba że w swoim produkcie dodasz etap wyszukiwania lub pobierania informacji. Jeśli pozostawić go samemu przewidywaniu, jak wygląda cytowanie, stworzy takie, które wygląda poprawnie: nazwisko autora, rok, tytuł czasopisma, numer tomu, DOI, bez weryfikacji, czy którekolwiek z tych danych odpowiada rzeczywistej publikacji. Część z nich będzie poprawna przypadkiem albo wskutek mechanicznego zapamiętania. Część zostanie zmyślona od podstaw i będzie wyglądać dokładnie tak samo.

Dlaczego Wskaźnik Zmyślania Wymaga Wersji Modelu i Daty

Ponieważ ten wskaźnik nie jest jedną liczbą. W najczęściej cytowanym badaniu na ten temat ChatGPT-3.5 zmyślił 55 procent cytowań w zestawie krótkich przeglądów literatury, a ChatGPT-4, testowany przez tych samych badaczy na tych samych 42 tematach, zmyślił 18 procent. To samo badanie, te same polecenia, ten sam dzień testowania. Zmienił się tylko model, a wskaźnik spadł o dwie trzecie.

Data ma takie samo znaczenie jak nazwa modelu. GPT-4 w tamtym badaniu oznaczał to, co OpenAI udostępniało w połowie 2023 roku. Badanie z 2026 roku obejmujące dziesięć aktualnych modeli i agentów badawczych, sprawdzające łącznie ponad 220,000 odnośników cytowań, wykazało wskaźniki fabrykacji od 3 percent do 13 percent, przy czym dokładna wartość zależała od konkretnego modelu oraz od tego, czy produkt korzystał z grounding wyszukiwania, czy z trybu deep research. Żadna z tych wartości nie jest błędna. Opisują one różne rzeczy mierzone niemal trzy lata od siebie.

Dziedzina również ma znaczenie, niezależnie od modelu. Mamy też badanie z zakresu ekonomii, przeprowadzone z użyciem tego samego zestawienia GPT-3.5 i GPT-4, które wykazało ponad 30 percent cytowań GPT-3.5 jako zmyślonych oraz wskaźnik nadal powyżej 20 percent dla GPT-4, zbliżony do tego, co wykazało badanie multidyscyplinarne, podczas gdy badanie systematycznego przeglądu medycznego, testujące konkretnie to, co oznaczono jako kompilację GPT-4 z marca 2023 roku, zmierzyło 28.6 percent w całkowicie innym zadaniu, polegającym na wyszukiwaniu odniesień do istniejących przeglądów systematycznych, a nie na pisaniu nowych streszczeń literatury od podstaw.

Co wykazały opublikowane badania

Sześć badań, przeprowadzonych między 2023 a 2026 rokiem, w obszarach medycyny, prawa, ekonomii i ogólnego pisania akademickiego, prowadzi do tego samego wniosku wyrażonego na sześć różnych sposobów: należy sprawdzać każde odniesienie podane przez narzędzie AI, niezależnie od tego, który model je wygenerował i kiedy.

Study and fieldModel and versionDate testedSampleFabrication rate
Walters and Wilder, Scientific Reports (multidisciplinary)ChatGPT-3.5 and ChatGPT-42023636 citations, 42 topics55% (3.5) versus 18% (4)
Buchanan, Hill and Shapoval, The American Economist (economics)GPT-3.5 and GPT-42023Prompts from Journal of Economic Literature topicsOver 30% (3.5), over 20% (4)
Chelli et al, JMIR (medical systematic reviews)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)Queried July 2023471 references, 11 reviews39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law)ChatGPT-4 and Llama 22024Random federal court case questions58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (mental health reviews)GPT-4oTested June 2025176 citations, 6 reviews19.9% fully fabricated, 56% fabricated or flawed
Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026Over 220,000 citation URLs3% to 13% depending on model

Badanie z zakresu prawa dodaje szczegół, którego sam surowy procent nie oddaje: to samo badanie wykazało, że modele mają trudność z przewidywaniem własnych halucynacji i mają tendencję do przyjmowania błędnej przesłanki użytkownika dotyczącej sprawy zamiast jej korygowania. Zmyślony cytat jest jednym z trybów awarii. Model, który dodatkowo nie potrafi wskazać własnej niepewności, stanowi trudniejszy problem, a ujawnia się to najbardziej właśnie w tej dziedzinie, w której błędny cytat wiąże się z najwyższym kosztem.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Czy ChatGPT stał się lepszy od 2023 roku?

Nieco tak, i nierówno. Najbardziej przejrzyste pojedyncze porównanie przed i po widać w samym badaniu Walters i Wilder: GPT-3.5 do GPT-4, tego samego dnia, odsetek zmyśleń spadł z 55 procent do 18 procent. Przejdźmy do GPT-4o w połowie 2025 roku, a wskaźnik zmierzony przez zespół Linardona wyniósł 19.9 percent, przy trudniejszym i węższym zadaniu, sześciu przeglądach literatury w jednej dziedzinie badawczej, a nie krótkich streszczeniach rozproszonych po 42 niepowiązanych tematach. Przejdźmy dalej do modeli z włączonymi funkcjami wyszukiwania lub deep-research, testowanych na początku 2026 roku, a zakres spada do jednocyfrowych wartości dla większości z nich, od 3 do 9 procent, choć jeden tryb deep-research nadal osiągnął 13.3 percent.

Nic z tego nie jest prostą linią spadkową. Liczba Linardona mieści się między wartością GPT-4 z 2023 roku a wartością GPT-3.5 z 2023 roku, mimo że dotyczy modelu wydanego ponad rok po obu z nich, ponieważ testowano go na trudniejszym zadaniu, rzeczywistym generowaniu przeglądu literatury w dziedzinie, w której znaczna część materiału źródłowego jest sama w sobie trudna do odnalezienia. Wskaźnik zmyśleń opisuje model, zadanie i datę. Zmień dowolny z tych trzech elementów, a liczba się zmieni, czasem bardzo wyraźnie.

Rodzina modelu nie jest jedyną zmienną, która dziś nadal wpływa na tę liczbę. Badanie z 2025 roku oceniające osiem darmowych chatbotów, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat i Perplexity, na 400 odwołaniach w pięciu dziedzinach akademickich wykazało, że tylko 26.5 percent wszystkich wygenerowanych odwołań było w pełni poprawnych. Grok i DeepSeek nie wygenerowały w tym teście żadnych zmyślonych odwołań. Claude, Copilot i Perplexity należały do najsłabszych. Dwa produkty oparte na porównywalnej technologii bazowej, testowane w tym samym miesiącu, na tych samych promptach, znalazły się na przeciwnych krańcach zakresu, co jest tą samą lekcją co powyższa tabela modelu i daty, zastosowaną do produktu, a nie do wersji.

Dlaczego zmyślone cytowania wyglądają wiarygodnie

Wymyślony cytat nie jest oczywistym symbolem zastępczym. Walters i Wilder ustalili, że ich zmyślone wpisy zawierały prawdziwe nazwiska autorów, osób publikujących w rzeczywistej dziedzinie, przypisane do tytułów czasopism, które naprawdę istnieją, sformatowane na tyle poprawnie, by przejść szybki ogląd wizualny. Zespół Linardona znalazł coś bardziej wyrazistego: spośród 35 zmyślonych cytatów wygenerowanych przez GPT-4o, 33 miały dołączony DOI, a 64 procent tych DOI prowadziło do rzeczywistej, opublikowanej pracy na całkowicie niezwiązany temat, nie do niedziałającego linku i nie do strony błędu, lecz do cudzych rzeczywistych badań podstawionych w miejsce źródła, które nie istnieje.

Jak sprawdzić, czy cytat z ChatGPT jest prawdziwy

Wyszukaj dokładny tytuł w Google Scholar lub na stronie samego czasopisma, zamiast ufać wyłącznie DOI, ponieważ działający DOI może prowadzić całkowicie do niewłaściwej pracy. Potwierdź, że lista autorów, rok i czasopismo zgadzają się z tym, co rzeczywiście się pojawia, a nie tylko to, że coś się pojawia. Zrób to dla każdego przypisu podanego przez chatbota, nie tylko dla tych, które wyglądają na nieznane, ponieważ zmyślone wpisy w tych badaniach były tworzone właśnie po to, by wyglądać zwyczajnie.

Traktuj nieznany lub wąski temat jako obarczony większym ryzykiem niż temat głównonurtowy. Zespół Linardona stwierdził odsetek zmyśleń na poziomie około 6 procent dla dobrze przebadanego schorzenia, dużego zaburzenia depresyjnego, oraz blisko 30 procent dla dwóch mniej przebadanych w tym samym zestawie przeglądów. Ten wzorzec utrzymuje się także poza zdrowiem psychicznym: model ma więcej rzeczywistego tekstu, z którego może wyprowadzać wzorce w zatłoczonej dziedzinie, i więcej przestrzeni do wiarygodnego wymyślania w dziedzinie ubogiej w dane.

Narzędzie do sprawdzania cytowań AI, które porównuje każdy wpis z rzeczywistą bazą danych naukowych automatyzuje to wyszukiwanie zamiast pozostawiać je ręcznemu sprawdzaniu każdego pojedynczego przypisu, a to właśnie ten etap większość osób pomija pod presją terminu, czyli w dokładnie takich warunkach, w których zmyślony cytat najłatwiej przetrwa do ostatecznej wersji tekstu.

Odnajdywanie ich w gotowej bibliografii to odrębna procedura i ma własną stronę. W przypadku cytatów, które są prawdziwe, cytowanie ChatGPT w APA zostało przedstawione krok po kroku.

Nic z tego nie zmienia sposobu formatowania cytowania po potwierdzeniu, że jest ono rzeczywiste. To jest osobne pytanie: How to cite ChatGPT obejmuje APA, MLA, Chicago i IEEE dla samej wymiany, a generator cytowań obsługuje zwykłe odniesienie w ten sam sposób, niezależnie od tego, w jakim stylu piszesz. Żaden format cytowania nie naprawi odniesienia do czegoś, co nigdy nie zostało opublikowane. Ta kontrola odbywa się przed formatowaniem, dla każdego odniesienia, niezależnie od tego, który model napisał Twój szkic albo którą wersję wskazuje jego etykieta.

Frequently Asked Questions

Czy ChatGPT zmyśla odniesienia? Tak, we wszystkich modelach testowanych do tej pory, we wszystkich opublikowanych badaniach z lat 2023 do 2026. Odsetek różni się ogromnie w zależności od wersji modelu, dziedziny i daty, od około 3 percent w najnowszych modelach z ugruntowaniem do ponad połowy w GPT-3.5 w 2023, więc pojedyncza liczba nigdy nie daje pełnej odpowiedzi.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.