Academic Writing

Чи вигадує ChatGPT посилання? Що показали дослідження фальсифікації

Шість досліджень, чотири галузі, три роки. Рівень, з яким ChatGPT вигадує посилання, коливається від однозначних чисел до понад половини, і це число нічого не означає без версії моделі та дати, що до нього прив'язані.

6 min
Does ChatGPT make up references: a table of studies by model version and year

У червні 2025 року дослідники з Deakin University попросили GPT-4o написати шість оглядів літератури на теми психічного здоров’я. Із 176 цитувань, які він згенерував, 35 взагалі не існували. Ще 64 посилалися на реальні статті, але з неправильними даними. Тобто одна з п’яти посилань була вигадана повністю, причому це було зроблено моделлю, випущеною більш ніж через рік після того, як проблему цитування в ChatGPT уперше виміряли в друкованій публікації.

Чи вигадує ChatGPT посилання? Так, і він досі робить це у 2026 році, на актуальних моделях, а не лише на версії, яка потрапила в заголовки у 2023 році. Відкрите питання ніколи не полягало в тому, чи це відбувається. Питання в тому, як часто, і це число змінюється залежно від моделі, версії, галузі та дати проведення тесту.

Чи вигадує ChatGPT посилання?

Так. Мовна модель прогнозує наступне ймовірне слово, спираючись на все, що було перед ним. Вона нічого не шукає, якщо ви не додаєте до свого продукту крок отримання даних або пошуку. Якщо її залишити прогнозувати, як виглядає цитування, вона створить таке, що виглядає правильним: ім’я автора, рік, назва журналу, номер тому, DOI, без перевірки того, чи відповідає будь-що з цього реальній публікації. Частина з цього буде точною випадково або завдяки механічному запам’ятовуванню. Частина буде вигадана з нуля і виглядатиме точно так само.

Чому рівень вигадування потребує версії моделі та дати

Тому що цей рівень не є одним числом. У найчастіше цитованому дослідженні на цю тему ChatGPT-3.5 вигадував 55 percent цитувань у наборі коротких оглядів літератури, а ChatGPT-4, протестований тими самими дослідниками на тих самих 42 темах, вигадував 18 percent. Те саме дослідження, ті самі запити, той самий день тестування. Єдине, що змінилося, була модель, і рівень знизився на дві третини.

Дата має таке ж значення, як і назва моделі. GPT-4 у тому дослідженні означав те, що саме OpenAI надавала в середині 2023 року. Дослідження 2026 року, присвячене десяти актуальним моделям і дослідницьким агентам, у якому загалом перевірили понад 220,000 посилань на цитати, виявило рівень вигадування від 3 percent до 13 percent, причому точне значення залежало від конкретної моделі та від того, чи використовував продукт пошукове обґрунтування, чи режим глибокого дослідження. Жодне з цих значень не є неправильним. Вони описують різні речі, виміряні майже з різницею у три роки.

Галузь також має значення, незалежно від моделі. Ми також маємо дослідження з економіки, проведене з тією самою парою GPT-3.5 і GPT-4, яке виявило, що понад 30 percent цитат GPT-3.5 були вигаданими, а для GPT-4 цей показник усе ще перевищував 20 percent, що близько до того, що виявило міждисциплінарне дослідження, тоді як дослідження медичного систематичного огляду, яке перевіряло саме те, що було позначено як збірка GPT-4 від March 2023, виміряло 28.6 percent на зовсім іншому завданні, а саме на доборі посилань для наявних систематичних оглядів, а не на написанні нових оглядів літератури з нуля.

Що виявили опубліковані дослідження

Шість досліджень, проведених між 2023 і 2026 роками, у медицині, праві, економіці та загальному академічному письмі, сходяться до одного й того самого висновку, сформульованого шістьма різними способами: перевіряйте кожне посилання, яке дає вам інструмент AI, незалежно від того, яка модель його створила і коли.

Study and fieldModel and versionDate testedSampleFabrication rate
Walters and Wilder, Scientific Reports (multidisciplinary)ChatGPT-3.5 and ChatGPT-42023636 citations, 42 topics55% (3.5) versus 18% (4)
Buchanan, Hill and Shapoval, The American Economist (economics)GPT-3.5 and GPT-42023Prompts from Journal of Economic Literature topicsПонад 30% (3.5), понад 20% (4)
Chelli et al, JMIR (medical systematic reviews)GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0)Queried July 2023471 references, 11 reviews39.6% (3.5), 28.6% (4), 91.4% (Bard)
Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law)ChatGPT-4 and Llama 22024Random federal court case questions58% (ChatGPT-4), 88% (Llama 2)
Linardon et al, JMIR Mental Health (mental health reviews)GPT-4oTested June 2025176 citations, 6 reviews19.9% fully fabricated, 56% fabricated or flawed
Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents)GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.52026Over 220,000 citation URLs3% to 13% depending on model

Юридичне дослідження додає деталь, яку не охоплює сам по собі відсоток: те саме дослідження показало, що моделі мають труднощі з передбаченням власних галюцинацій і схильні приймати хибну передумову користувача щодо справи замість того, щоб виправляти її. Сфабрикована цитата є одним із режимів відмови. Модель, яка також не може позначити власну невизначеність, є складнішою проблемою, і це найвиразніше проявляється саме в тій галузі, де хибна цитата має найвищу ціну.

Humanize your own paper

Transform your AI-assisted text and make it sound human, without touching important words or citations.

Get started free

Чи став ChatGPT кращим від 2023 року?

Певною мірою, і нерівномірно. Найчіткіше окреме порівняння до і після є в самому дослідженні Walters and Wilder: GPT-3.5 до GPT-4, того самого дня, частка вигаданих посилань знизилася з 55 percent до 18 percent. Якщо перейти до GPT-4o в середині 2025 року, то показник, виміряний командою Linardon, становив 19.9 percent, причому на складнішому і вужчому завданні, шість оглядів літератури в одній галузі досліджень, а не короткі підсумки, розподілені між 42 непов’язаними темами. Якщо перейти ще далі до моделей із увімкненими функціями пошуку або deep-research, протестованих на початку 2026 року, то діапазон для більшості з них знижується до однозначних значень, від 3 до 9 percent, хоча один режим deep-research усе ще досягав 13.3 percent.

Усе це не є прямою лінією вниз. Показник Linardon лежить між цифрою GPT-4 за 2023 рік і цифрою GPT-3.5 за 2023 рік, на моделі, випущеній більш ніж через рік після обох, тому що її тестували на складнішому завданні, реальному генеруванні огляду літератури в галузі, де значну частину джерельного матеріалу саму по собі важко знайти. Частка вигаданих посилань описує модель на певному завданні в певну дату. Змініть будь-який із цих трьох чинників, і число зміниться, іноді дуже суттєво.

Сімейство моделі не є єдиною змінною, яка й сьогодні впливає на це число. Дослідження 2025 року, що оцінювало вісім безкоштовних чатботів, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat і Perplexity, на 400 посиланнях у п’яти академічних галузях, показало, що лише 26.5 percent усіх згенерованих посилань були повністю правильними. Grok і DeepSeek у цьому тесті не створили жодного вигаданого посилання. Claude, Copilot і Perplexity були серед найгірших за результатами. Два продукти, побудовані на порівнюваній базовій технології, протестовані в той самий місяць, на тих самих запитах, опинилися на протилежних кінцях діапазону, і це той самий урок, що й у таблиці моделей і дат вище, застосований до продукту, а не до версії.

Чому вигадані цитати виглядають реальними

Сфабрикована цитата не є очевидним заповнювачем. Walters and Wilder виявили, що їхні вигадані записи містили справжні імена авторів, тих, хто публікується в реальній галузі, були прив’язані до назв журналів, які справді існують, і були оформлені достатньо добре, щоб пройти швидку візуальну перевірку. Команда Linardon знайшла дещо ще точніше: із 35 сфабрикованих цитат, які згенерував GPT-4o, 33 мали прикріплений DOI, і 64 percent цих DOI вели до реальної, опублікованої статті на зовсім не пов’язану тему, не до непрацюючого посилання і не до сторінки помилки, тобто чиєсь справжнє дослідження підміняло джерело, якого не існує.

Як перевірити, чи є цитата ChatGPT справжньою

Шукайте точну назву в Google Scholar або на власному сайті журналу, а не покладайтеся лише на DOI, оскільки робочий DOI може вказувати зовсім не на ту статтю. Перевірте, чи збігаються список авторів, рік і журнал із тим, що справді знаходиться, а не лише те, що щось знаходиться. Робіть це для кожного посилання, яке дає чатбот, а не тільки для тих, що виглядають незнайомими, оскільки сфабриковані записи в цих дослідженнях були створені саме так, щоб виглядати звичайними.

Ставтеся до незнайомої або вузької теми як до більш ризикованої, ніж до мейнстримної. Команда Linardon виявила рівень фальсифікації близько 6 percent для добре вивченого стану, major depressive disorder, і близько 30 percent для двох менш вивчених у тому самому наборі оглядів. Ця закономірність зберігається і поза межами психічного здоров’я: у переповненій галузі модель має більше реального тексту, з якого можна виводити закономірності, і більше простору для правдоподібного вигадування в біднішій на матеріал галузі.

AI citation checker, який перевіряє кожен запис за реальною науковою базою даних автоматизує цей пошук замість того, щоб залишати його на ручну перевірку для кожного окремого посилання, а саме цю частину більшість людей пропускає під тиском дедлайну, тобто в тих самих умовах, за яких сфабрикована цитата найімовірніше потрапляє до фінального чернеткового варіанта.

Знайти їх у завершеному списку літератури це окрема процедура і для неї є окрема сторінка. Для тих цитат, які є справжніми, цитування ChatGPT в APA подано крок за кроком.

Усе це не змінює того, як ви оформлюєте цитату після того, як підтвердили, що вона справжня. Це окреме питання: How to cite ChatGPT охоплює APA, MLA, Chicago та IEEE для самого обміну, а генератор цитат опрацьовує звичайне посилання однаково, незалежно від того, у якому стилі ви пишете. Жоден формат цитування не може виправити посилання на те, що ніколи не було опубліковано. Цю перевірку виконують до форматування, для кожного посилання, незалежно від того, яка модель написала ваш чернетковий текст або яку версію стверджує її позначка.

Frequently Asked Questions

Чи вигадує ChatGPT посилання? Так, у кожній протестованій моделі, у кожному опублікованому дослідженні з 2023 по 2026 рік. Рівень дуже сильно відрізняється залежно від версії моделі, галузі та дати, від приблизно 3 відсотків на найновіших моделях із підкріпленням до понад половини на GPT-3.5 у 2023 році, тож одне число ніколи не дає повної відповіді.

Sara

Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.