AI Humanization

Признак длинного тире: почему ChatGPT злоупотребляет им

Что именно вызывает привычку ChatGPT опираться на длинное тире, какую функцию этот знак выполняет в предложении и к чему вместо него обращается человек-редактор: к запятой, двоеточию или точке.

5 min
Table showing what a human writer uses instead of the chatgpt em dash habit, by sentence function

Иногда менеджер по найму отправляет сопроводительное письмо коллеге с добавленной строкой: проверьте тире. Этот длинный знак встречается три раза в двух предложениях, один раз как запятая, один раз как двоеточие и один раз как точка, и все это в одном и том же абзаце. Небольшая привычка, которая есть у chatgpt, состоит в том, что вы замечаете тире еще до того, как прочитаете мысль. Важно правильно понять эту привычку, прежде чем делать какие-либо выводы о том, что она на самом деле означает. Этот рефлекс, когда знак замечают до чтения аргумента, в миниатюре и есть привычка chatgpt к длинному тире, и ее стоит правильно понять, прежде чем решать, что она на самом деле доказывает.

Длинное тире, более длинное, чем дефис, и более длинное, чем тире, используемое в диапазоне чисел, это знак, который автор вставляет в середине предложения, чтобы выполнить функцию запятой, двоеточия или точки. ChatGPT использует его чаще, чем это делает большинство отредактированных текстов, хотя то, насколько именно чаще, зависит от того, какая версия модели создала абзац перед вами. Этот материал сосредоточен только на этом одном знаке: что вызывает эту привычку, какую функцию он на самом деле выполняет, когда появляется, и что вместо него подставляет человек-редактор.

Что вызывает привычку ChatGPT к длинному тире?

Никто в OpenAI не публиковал технического объяснения, но многое из того, что нам известно, стало результатом независимого исследования, без необходимости в корпоративной записи в блоге. Один хороший пример, это подробный анализ, написанный инженером-программистом Sean Goedecke в октябре 2025 года. Вместо догадок он сам проверил простые теории. Он попробовал модель, которая экономила токены, используя один знак вместо запятой. Но запятая ровно настолько же короткая. Он также проверил предпочтение диалекта, усвоенное от работников, дающих обратную связь людям, и изучил большую выборку текста на Nigerian English, диалекта, который обычно связывают с этой рабочей силой. На самом деле там этот знак встречался реже, чем в обычном современном английском, а не чаще.

Теория, которую собственные испытания Goedecke оставили в силе, указывает на изменение в обучающих данных между версиями модели. Он обнаружил, что эта привычка едва заметна в выводе GPT-3.5, а после выпуска GPT-4o стала примерно в десять раз более частой, что указывает скорее на изменения в обучающем наборе, чем на саму архитектуру модели. Его лучшее предположение, это оцифрованные книги конца 1800-х и начала 1900-х годов, период, когда этот знак встречался в печатном английском необычно часто, значительно выше, чем в современном письме. Никто вне лабораторий, которые обучали эти модели, не может это подтвердить. Это наиболее тщательно проверенная доступная теория, а не установленный факт.

Отдельное направление исследований, опубликованное в March 2026, указывает на связанную причину, которую стоит назвать: какая часть обучающего текста модели была оформлена в markdown, а не в виде обычной прозы, исходя из предположения, что сильное воздействие такого стиля форматирования оставляет собственный след на выборе знаков препинания в целом. Честный итог состоит в том, что несколько объяснений правдоподобны, одно достаточно хорошо проверено, и ни одно не подтверждено той стороной, которая действительно могла бы это подтвердить.

Какую функцию выполняет знак в предложении?

Прежде чем выбирать замену, полезно назвать функцию, которую выполняет знак, потому что запятая, двоеточие и точка не взаимозаменяемы, как и их заменители в виде длинного тире. Почти все случаи, с которыми может столкнуться читатель, охватываются четырьмя функциями.

Что делает знакЧто вместо этого использует человек-писательПример
Выделение вставного замечания внутри предложенияПара запятых или скобкиВывод, подтверждённый дважды, сохранялся при обоих условиях.
Обозначение резкого поворота или внезапного прерыванияТочка и новое предложениеВывод сохранялся при обоих условиях. При третьем он не выдержал.
Соединение двух тесно связанных самостоятельных утвержденийТочка или, если связь существенна, точка с запятойВыборка была небольшой. Размер эффекта не был таким.
Введение списка, резюме или объясненияДвоеточиеРезультат указывал в одну сторону: репликация не удалась.

Каждое из этих предложений было таким, в котором этот знак можно было бы использовать, но он не был использован. Этот фрагмент сам по себе является аргументом в пользу того, что этот знак служит машинным признаком, и он доказывает это, ни разу не используя символ, который описывает, ни в одном предложении выше или ниже.

Очеловечить свою работу

Преобразуйте текст, созданный с помощью AI, и сделайте его более естественным, не затрагивая важные слова или цитаты.

Начать бесплатно

Одинакова ли привычка использовать длинное тире у всех чатботов?

Нет, и различие между системами велико. Тест с одинаковым запросом для шести чатботов в середине 2025 года, на который ссылается более широкий руководство TextPulse по паттернам письма ИИ, показал, что три системы использовали этот знак примерно один раз на семьдесят слов, а одна, примерно один раз на четыреста семьдесят, тогда как две другие не использовали его вовсе в выборке. Частотность является свойством той системы и той версии, которые сгенерировали перед вами данный абзац, а не фиксированной чертой письма ИИ в целом.

OpenAI выпустила частичное исправление в ноябре 2025: настройку пользовательских инструкций, которая, после того как пользователь её включает, говорит модели прекратить это. Sam Altman объявил об этом сам, представив это как наконец-то услышанную давнюю жалобу. Эта настройка является необязательной, а не настройкой по умолчанию, поэтому огромное количество повседневных ответов ChatGPT никогда не было ею затронуто, и эта привычка сохраняется там, где никто не потрудился переключить этот параметр.

Репутация этого знака как признака ИИ сама по себе возникла сравнительно недавно и несколько преувеличена. По данным комментариев, отслеживающих эту реакцию, отторжение началось примерно в феврале 2025. В одной популярной статье об этой тенденции отмечалось, что никогда не было надёжных доказательств того, что чатботы используют этот знак чаще, чем это уже делали внимательные человеческие авторы. Эти два утверждения могут сосуществовать: привычка реальна и измерима в сыром тексте, а уверенность интернета в том, что её можно распознать по одному предложению, заметно опережает фактические доказательства.

Как проверить свой черновик на эту привычку

Прочитайте абзац вслух и отметьте каждое место, где появляется длинное тире. Один случай на странице, это стилистический выбор, к которому человеческие авторы прибегают уже столетиями. Несколько в одном абзаце, особенно если они выполняют разные функции из таблицы выше, заслуживают повторной проверки. Такая плотность необычна вне текста, созданного ИИ, и вне нескольких авторов, сознательно использующих тире очень часто.

Бесплатный удалитель длинных тире от TextPulse автоматически проверяет такую плотность и предлагает запятую, двоеточие, точку или перестройку там, где это требуется в каждом отдельном случае, что быстрее, чем считать вручную в длинном документе. Та же коллекция бесплатных инструментов охватывает и другие уровни, на которые обычно сразу указывает машинно составленный абзац, выбор слов, ритм предложений и структуру, обеспечивая проверку, выходящую за пределы одной только пунктуации.

Слова-паразиты выполняют ту же работу на уровне предложения, и есть список тех, которые стоит удалить в первую очередь. Удаление этой лексики из уже написанного черновика требует уже иного подхода.

Для проверки всего этого не требовалось специального программного обеспечения, только внимание и готовность перечитать предложение ещё раз. В этой статье тот же выбор последовательно делался и в процессе её собственного написания: тянуться к запятой, двоеточию или точке, и ни разу не обращаться к знаку, который она описывала на протяжении пятнадцати сотен слов.

XLinkedInFacebook

Часто задаваемые вопросы

Привычка ChatGPT к длинному тире в основном связана с тем, что изменилось в его обучающих данных между версиями модели, а не с сознательным решением при проектировании. Независимое тестирование показало, что этот знак встречается в выводе GPT-4o гораздо чаще, чем в GPT-3.5, а ведущая теория указывает на интенсивное воздействие старых печатных книг из периода, когда этот знак использовался необычно часто. OpenAI не публиковала собственного объяснения, поэтому это остаётся наилучшей подтверждённой теорией, а не установленным фактом.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.