ChatGPT выдумывает ссылки? Что показали исследования о фабрикации
Шесть исследований, четыре области, три года. Доля ссылок, которые ChatGPT выдумывает, колеблется от однозначных значений до более чем половины, и это число ничего не значит без версии модели и даты.
В июне 2025 года исследователи из Deakin University попросили GPT-4o написать шесть обзоров литературы по темам психического здоровья. Из 176 цитат, которые он сгенерировал, 35 вообще не существовали. Ещё 64 указывали на реальные статьи, но с неверными сведениями. Иными словами, одна ссылка из пяти была выдумана полностью, причём это сделал модель, выпущенная более чем через год после того, как проблема цитирования у ChatGPT была впервые измерена в печати.
ChatGPT выдумывает ссылки? Да, и в 2026 году он по-прежнему это делает, на актуальных моделях, а не только на версии, которая привлекла внимание в 2023 году. Открытым вопросом никогда не было, происходит ли это. Вопрос в том, как часто, и это число меняется в зависимости от модели, версии, области и даты проведения теста.
ChatGPT выдумывает ссылки?
Да. Языковая модель предсказывает следующее правдоподобное слово, исходя из всего, что было до него. Она ничего не ищет, если только в вашем продукте не добавлен этап поиска или извлечения информации. Если оставить её предсказывать, как выглядит ссылка, она создаст такую, которая выглядит корректно: имя автора, год, название журнала, номер тома, DOI, без проверки того, соответствуют ли все эти сведения реальной публикации. Часть из этого будет точной случайно или благодаря механическому запоминанию. Часть будет выдумана с нуля и будет выглядеть точно так же.
Почему для оценки частоты выдумывания нужна версия модели и дата
Потому что эта частота не является одним числом. В самом цитируемом исследовании на эту тему ChatGPT-3.5 выдумал 55 процентов цитат в наборе коротких обзоров литературы, а ChatGPT-4, протестированный теми же исследователями по тем же 42 темам, выдумал 18 процентов. То же исследование, те же запросы, тот же день тестирования. Изменилось только модель, и показатель снизился на две трети.
Дата имеет не меньшее значение, чем название модели. GPT-4 в том исследовании означал то, что OpenAI предоставляла в середине 2023 года. Исследование 2026 года, посвящённое десяти актуальным моделям и исследовательским агентам и проверившее в общей сложности более 220,000 ссылок на цитирования, выявило долю вымышленных ссылок от 3 percent до 13 percent, при этом точное значение зависело от конкретной модели и от того, использовал ли продукт поисковое обоснование или режим глубокого исследования. Ни одна из этих цифр не является ошибочной. Они описывают разные вещи, измеренные почти с разницей в три года.
Область также имеет значение, независимо от модели. У нас также было исследование в области экономики, проведённое через ту же пару GPT-3.5 и GPT-4, которое выявило, что более 30 percent цитат GPT-3.5 были выдуманы, а показатель для GPT-4 всё ещё превышал 20 percent, что близко к тому, что показало междисциплинарное исследование, тогда как исследование систематического обзора в медицине, специально тестировавшее то, что было обозначено как сборка GPT-4 от March 2023, измерило 28.6 percent на совершенно иной задаче, а именно при извлечении ссылок для уже существующих систематических обзоров, а не при написании новых литературных обзоров с нуля.
Что показали опубликованные исследования
Шесть исследований, проведённых в период с 2023 по 2026 год в области медицины, права, экономики и общего академического письма, сходятся к одному и тому же выводу, сформулированному шестью разными способами: проверяйте каждую ссылку, которую даёт вам инструмент AI, независимо от того, какая модель её сгенерировала и когда.
| Исследование и область | Модель и версия | Дата тестирования | Выборка | Доля вымышленных ссылок |
|---|---|---|---|---|
| Walters and Wilder, Scientific Reports (multidisciplinary) | ChatGPT-3.5 and ChatGPT-4 | 2023 | 636 citations, 42 topics | 55% (3.5) versus 18% (4) |
| Buchanan, Hill and Shapoval, The American Economist (economics) | GPT-3.5 and GPT-4 | 2023 | Prompts from Journal of Economic Literature topics | Over 30% (3.5), over 20% (4) |
| Chelli et al, JMIR (medical systematic reviews) | GPT-3.5, GPT-4 (gpt-4-32k-0314 build), Bard (PaLM 2.0) | Queried July 2023 | 471 references, 11 reviews | 39.6% (3.5), 28.6% (4), 91.4% (Bard) |
| Dahl, Magesh, Suzgun and Ho, Journal of Legal Analysis (law) | ChatGPT-4 and Llama 2 | 2024 | Random federal court case questions | 58% (ChatGPT-4), 88% (Llama 2) |
| Linardon et al, JMIR Mental Health (mental health reviews) | GPT-4o | Tested June 2025 | 176 citations, 6 reviews | 19.9% fully fabricated, 56% fabricated or flawed |
| Rao, Wong and Callison-Burch, arXiv preprint (multi-domain, deep research agents) | GPT-4.1, GPT-4o-search-preview, Claude 3.5 and 3.7 Sonnet, Gemini 2.5 | 2026 | Over 220,000 citation URLs | 3% to 13% depending on model |
Юридическое исследование добавляет деталь, которую не отражает простой процент: то же исследование показало, что модели с трудом предсказывают собственные галлюцинации и, как правило, принимают неверную предпосылку пользователя о деле вместо того, чтобы исправить ее. Вымышленная ссылка, это один из вариантов сбоя. Модель, которая к тому же не может обозначить собственную неопределенность, представляет собой более сложную проблему, и она проявляется прежде всего именно в той области, где неверная ссылка имеет наибольшую цену.
Humanize your own paper
Transform your AI-assisted text and make it sound human, without touching important words or citations.
Стало ли ChatGPT лучше с 2023 года?
В некоторой степени, и неравномерно. Самое ясное единичное сравнение до и после содержится в самом исследовании Walters and Wilder: GPT-3.5 к GPT-4, в тот же день, доля вымышленных ссылок снизилась с 55 процентов до 18 процентов. Если перейти к GPT-4o в середине 2025 года, то показатель, измеренный командой Linardon, составил 19.9 процента, при более сложной и более узкой задаче, шести обзорах литературы в одной исследовательской области, а не кратких сводках по 42 не связанным между собой темам. Если перейти ещё дальше к моделям, у которых включены функции поиска или deep-research, протестированным в начале 2026 года, диапазон для большинства из них снижается до однозначных значений, от 3 до 9 процентов, хотя один режим deep-research всё же достиг 13.3 процента.
Ничто из этого не представляет собой прямую линию вниз. Показатель Linardon находится между значением GPT-4 за 2023 год и значением GPT-3.5 за 2023 год, при том что модель была выпущена более чем через год после обеих, потому что её тестировали на более сложной задаче, на реальном генерировании обзора литературы в области, где значительная часть исходного материала сама по себе труднодоступна. Доля вымышленных ссылок описывает модель на задаче в определённую дату. Измените любой из этих трёх параметров, и число изменится, иногда существенно.
Семейство модели не является единственной переменной, которая и сегодня влияет на это число. Исследование 2025 года, оценивавшее восемь бесплатных чатботов, ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, Le Chat и Perplexity, по 400 ссылкам в пяти академических областях, показало, что лишь 26.5 процента всех сгенерированных ссылок были полностью корректными. Grok и DeepSeek в этом тесте не сгенерировали ни одной вымышленной ссылки. Claude, Copilot и Perplexity оказались среди худших. Два продукта, построенные на сопоставимой базовой технологии, протестированные в один и тот же месяц, на одних и тех же запросах, оказались на противоположных концах диапазона, и это тот же самый вывод, что и в таблице по моделям и датам выше, только применённый к продукту, а не к версии.
Почему вымышленные цитаты выглядят правдоподобно
Сфабрикованная ссылка не является очевидной заглушкой. Walters и Wilder установили, что в их вымышленных записях были реальные имена авторов, тех, кто публикуется в настоящей области, привязанные к названиям журналов, которые действительно существуют, и оформленные достаточно хорошо, чтобы пройти быстрый визуальный просмотр. Команда Linardon обнаружила нечто более точное: из 35 сфабрикованных ссылок, которые сгенерировал GPT-4o, 33 содержали DOI, и 64 процента этих DOI вели к реальной, опубликованной статье на совершенно не связанную тему, не к неработающей ссылке и не к странице ошибки, то есть чьё-то настоящее исследование подменяло источник, которого не существует.
Как проверить, является ли ссылка ChatGPT реальной
Ищите точное название в Google Scholar или на собственном сайте журнала, а не полагайтесь только на DOI, поскольку рабочий DOI может указывать совсем не на ту статью. Проверьте, что список авторов, год и журнал совпадают с тем, что действительно находится, а не только то, что что-то находится. Делайте это для каждой ссылки, которую даёт чатбот, а не только для тех, которые кажутся незнакомыми, поскольку сфабрикованные записи в этих исследованиях были специально созданы так, чтобы выглядеть обычными.
Считайте незнакомую или узкую тему более рискованной, чем распространённую. Команда Linardon обнаружила уровень фальсификации около 6 процентов для хорошо изученного состояния, major depressive disorder, и около 30 процентов для двух менее изученных в том же наборе обзоров. Эта закономерность сохраняется и за пределами психического здоровья: в насыщенной области у модели больше реального текста, на основе которого можно выводить закономерности, и больше пространства для правдоподобного вымысла в узкой области.
Проверка ссылок на основе AI, которая сопоставляет каждую запись с реальной научной базой данных автоматизирует этот поиск вместо того, чтобы оставлять его на ручную проверку каждой отдельной ссылки, а именно эту часть большинство людей пропускает под давлением сроков, то есть в точности в тех условиях, при которых сфабрикованная ссылка с наибольшей вероятностью доживёт до финального черновика.
Обнаружение их в готовом списке литературы представляет собой отдельную процедуру и имеет собственную страницу. Для тех ссылок, которые являются реальными, оформление ChatGPT в APA изложено шаг за шагом.
Ничто из этого не меняет того, как вы оформляете цитату после того, как подтвердили, что она реальна. Это отдельный вопрос: Как цитировать ChatGPT, охватывает APA, MLA, Chicago и IEEE для самого обмена, а генератор цитирования обрабатывает обычную ссылку одинаково, независимо от того, в каком стиле вы пишете. Ни один формат цитирования не может исправить ссылку на то, что никогда не было опубликовано. Эта проверка происходит до форматирования, для каждой ссылки, независимо от того, какая модель написала ваш черновик или какую версию утверждает её метка.
Frequently Asked Questions
ChatGPT выдумывает ссылки? Да, на каждой модели, которую пока тестировали, в каждом опубликованном исследовании с 2023 по 2026 год. Показатель сильно различается в зависимости от версии модели, области и даты, от примерно 3 процентов на самых новых grounded-моделях до более чем половины на GPT-3.5 в 2023 году, поэтому одно число никогда не даёт полного ответа.
Content planner and copywriter at TextPulse. Sara runs the blog day to day, from planning and drafting through to publishing. She writes the practical guides: clear explanations of academic writing problems, aimed at the person who actually has to hand something in.