Ознака довгого тире: чому ChatGPT надмірно його вживає
Що саме спричиняє звичку ChatGPT спиратися на довге тире, яку функцію цей знак виконує в реченні, і до чого натомість вдається людина-редактор: до коми, двокрапки або крапки.
Іноді менеджер з найму надсилає супровідний лист колезі з доданим рядком: перевірте тире. Цей довгий різновид з’являється тричі у двох реченнях, один раз як кома, один раз як двокрапка і один раз як крапка, усе в одному абзаці. Така мала звичка, яка є у chatgpt, полягає в тому, що ви бачите тире ще до того, як прочитаєте зміст. Важливо правильно зрозуміти цю звичку, перш ніж робити будь-які висновки про те, що вона насправді означає. Цей рефлекс, помічати знак ще до читання аргументу, є мініатюрною версією звички chatgpt до em dash, і варто правильно її зрозуміти, перш ніж вирішувати, що вона насправді доводить.
Em dash, це довге тире, довше за дефіс і довше за тире, яке використовують у числовому діапазоні, яке автор вставляє всередині речення, щоб виконати роль коми, двокрапки або крапки. ChatGPT використовує його частіше, ніж це робить більшість відредагованої прози, хоча те, наскільки саме частіше, залежить від того, яка версія моделі створила абзац перед вами. Цей текст зосереджується лише на цьому одному знаку: що спричиняє цю звичку, яку функцію він насправді виконує, коли з’являється, і що замість нього підставляє людський редактор.
Що спричиняє звичку ChatGPT до Em Dash?
Ніхто в OpenAI не опублікував технічного пояснення, але значна частина того, що нам відомо, стала можливою завдяки незалежному дослідженню, без потреби в дописі компанії в блозі. Один добрий приклад, це ґрунтовний аналіз, написаний інженером-програмістом Sean Goedecke у жовтні 2025 року. Замість здогадів він сам перевірив прості теорії. Він випробував модель, яка заощаджувала токени, використовуючи один знак замість коми. Але кома є точно такою ж короткою. Він також перевірив уподобання діалекту, засвоєне від працівників, які надають людський зворотний зв’язок, і проаналізував великий зразок тексту Nigerian English, діалекту, який зазвичай пов’язують із цією робочою силою. Насправді там воно траплялося рідше, ніж у звичайній сучасній англійській, а не частіше.
Теорія, яку власне тестування Goedecke залишило в силі, вказує на зміну в навчальних даних між версіями моделі. Він виявив, що ця звичка ледь помітна у виході GPT-3.5, а після випуску GPT-4o стала приблизно вдесятеро частішою, що вказує на те, що змінилося саме в навчальному наборі, а не в архітектурі моделі. Його найкраще припущення, це оцифровані книги кінця 1800-х і початку 1900-х років, періоду, коли цей знак був незвично поширеним у друкованій англійській мові, значно частіше, ніж у сучасному письмі. Ніхто поза лабораторіями, які навчали ці моделі, не може цього підтвердити. Це найретельніше перевірена доступна теорія, а не встановлений факт.
Окрема лінія досліджень, опублікована в березні 2026 року, вказує на пов'язану причину, яку варто назвати: яку частку навчального тексту моделі було відформатовано як markdown, а не як звичайну прозу, виходячи з припущення, що сильний вплив такого стилю форматування залишає власний відбиток на виборі розділових знаків загалом. Чесний підсумок такий, що кілька пояснень є правдоподібними, одне з них досить добре перевірене, і жодне не підтверджене тією стороною, яка справді могла б це підтвердити.
Яку роль виконує знак у реченні?
Перш ніж обирати заміну, корисно назвати роль, яку виконує цей знак, тому що кома, двокрапка і крапка не є взаємозамінними, і те саме стосується їхніх замінників у вигляді довгого тире. Чотири ролі охоплюють майже всі випадки, з якими читач може зіткнутися.
| Що робить цей знак | Що натомість використовує людський автор | Приклад |
|---|---|---|
| Виділяє вставне зауваження всередині речення | Пара ком, або дужки | Висновок, підтверджений двічі, зберігався за обох умов. |
| Позначає різкий поворот або раптову перерву | Крапка і нове речення | Висновок зберігався за обох умов. Він не витримав третьої. |
| Поєднує два тісно пов'язані незалежні твердження | Крапка, або крапка з комою, якщо зв'язок має значення | Вибірка була малою. Розмір ефекту ні. |
| Вводить перелік, підсумок або пояснення | Двокрапка | Результат вказував в один бік: реплікація не вдалася. |
Кожне з цих речень було таким, у якому цей знак можна було б використати, але його не використали. Цей текст сам по собі є аргументом на користь того, що цей знак є машинною ознакою, і він вибудовує цей аргумент, ніколи не використовуючи символ, який описує, жодного разу, ні в одному реченні вище чи нижче.
Гуманізуйте свою власну статтю
Перетворіть текст, створений за допомогою AI, і зробіть його природним, не змінюючи важливих слів або цитат.
Чи однакова звичка до тире в кожного Chatbot?
Ні, і розрив між системами є значним. Тест із однаковим запитом для шести чатботів у середині 2025 року, на який посилаються у ширшому посібнику TextPulse з шаблонів письма AI, показав, що три системи продукували цей знак приблизно раз на сімдесят слів, а одна продукувала його приблизно раз на чотириста сімдесят, тоді як дві інші не продукували його взагалі у вибірці. Частотність є властивістю тієї системи і тієї версії, які згенерували абзац перед вами, а не сталою рисою письма AI загалом.
OpenAI випустила часткове виправлення в листопаді 2025 року, налаштування користувацьких інструкцій, яке, коли користувач вмикає його, наказує моделі припинити це. Сам Altman оголосив про це, подавши це як нарешті почуту давню скаргу. Це налаштування є опційним, а не типовим, тож величезна частина повсякденного виводу ChatGPT ніколи не була ним зачеплена, і ця звичка зберігається всюди, де ніхто не потрудився перемкнути цей режим.
Репутація цього знака як ознаки ШІ сама по собі є доволі недавньою і певною мірою перебільшеною. Зворотна реакція почалася приблизно в лютому 2025 року, якщо судити за коментарями, що відстежували це. У популярному матеріалі про цю тенденцію зазначалося, що ніколи не було переконливих доказів того, що чатботи використовують цей знак частіше, ніж це вже робили уважні люди, які пишуть. Обидві речі можуть співіснувати: ця звичка є реальною і вимірюваною в сирому вихідному тексті, а впевненість інтернету в тому, що її можна помітити за одним реченням, значно випереджає наявні докази.
Як перевірити власний чернетковий текст на цю звичку
Прочитайте абзац уголос і позначте кожне місце, де з'являється довге тире. Один випадок на сторінці, це стилістичний вибір, такий, який люди, що пишуть, робили століттями. Кілька в одному абзаці, особливо якщо вони виконують різні функції порівняно з таблицею вище, варто переглянути ще раз. Така щільність є незвичною поза межами вихідного тексту ШІ і поза межами кількох авторів, які свідомо пишуть із великою кількістю тире.
Безкоштовний інструмент TextPulse для видалення em dash автоматично перевіряє таку щільність і пропонує кому, двокрапку, крапку або перебудову там, де це потрібно для кожного окремого випадку, що швидше, ніж рахувати вручну впродовж усього довгого документа. Така сама добірка безкоштовних інструментів охоплює й інші рівні, на які зазвичай одночасно вказує абзац, створений машиною, вибір слів, ритм речень і структуру, для перевірки, що виходить за межі лише пунктуації.
Заповнювальні фрази виконують ту саму роботу на рівні речення, і є список тих, які варто вирізати першими. Видалення цієї лексики з чернетки, яку ви вже написали, знову передбачає інший підхід.
Для перевірки всього цього не було потрібно спеціального програмного забезпечення, лише увага і готовність перечитати речення ще раз. У цій статті під час власного написання було обрано той самий підхід у всьому тексті, тягнутися до коми, двокрапки або крапки, і жодного разу не до знака, який у п'ятнадцятистах словах було описано.
Часті запитання
Звичка ChatGPT до довгого тире зумовлена переважно тим, що змінилося в його навчальних даних між версіями моделі, а не свідомим дизайнерським рішенням. Незалежне тестування показало, що цей знак значно частіше трапляється у виводі GPT-4o, ніж у GPT-3.5, а провідна теорія вказує на інтенсивний вплив старих друкованих книжок із періоду, коли цей знак траплявся незвично часто. OpenAI не оприлюднила власного пояснення, тож це лишається найкраще обґрунтованою теорією, а не підтвердженим фактом.
Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.