AI Humanization

Em dash jako prozrazení: proč ho ChatGPT nadužívá

Co vlastně způsobuje zvyk ChatGPT opírat se o em dash, jakou funkci toto znaménko v souvětí plní a po čem sáhne lidský editor místo něj: po čárce, dvojtečce nebo tečce.

5 min
Table showing what a human writer uses instead of the chatgpt em dash habit, by sentence function

Někdy pošle vedoucí náboru motivační dopis kolegovi s přidaným řádkem: zkontrolujte pomlčky. Tento dlouhý druh se ve dvou větách objevuje třikrát, jednou jako čárka, jednou jako dvojtečka a jednou jako tečka, vše ve stejném odstavci. Ten drobný zvyk, který má chatgpt, je ten, kdy pomlčku uvidíte dřív, než si přečtete pointu. Je důležité tomuto zvyku správně porozumět, než člověk vyvodí jakékoli závěry o tom, co vlastně znamená. Tento reflex, tedy všimnout si znaku dřív, než si přečtete argument, je em dash zvyk chatgpt v malém, a stojí za to mu správně porozumět, než se rozhodnete, co vlastně dokazuje.

Em dash je dlouhá pomlčka, delší než spojovník a delší než pomlčka používaná v číselném rozmezí, kterou autor vkládá doprostřed věty, aby zastoupila čárku, dvojtečku nebo tečku. ChatGPT ji používá častěji, než je obvyklé v běžně redigované próze, i když přesně o kolik častěji, to závisí na tom, která verze modelu vytvořila odstavec, který máte před sebou. Tento text se úzce soustředí jen na tento jeden znak, na to, co tento zvyk způsobuje, jakou funkci ve skutečnosti plní, když se objeví, a čím jej lidský editor nahrazuje.

Co způsobuje zvyk ChatGPT používat em dash?

Nikdo v OpenAI nezveřejnil technické vysvětlení, ale velká část toho, co víme, pochází z nezávislého zkoumání, není třeba žádný firemní blogový příspěvek. Jedním dobrým příkladem je podrobná analýza, kterou v říjnu 2025 napsal softwarový inženýr Sean Goedecke. Místo hádání si sám vyzkoušel jednoduché teorie. Otestoval model, který šetřil tokeny tím, že používal jeden znak místo čárky. Jenže čárka je přesně stejně krátká. Vyzkoušel také preferenci dialektu převzatou od pracovníků poskytujících lidskou zpětnou vazbu a zkontroloval velký vzorek textu v nigerijské angličtině, tedy dialektu běžně spojovaného s touto pracovní silou. Ve skutečnosti se tam objevovala méně často než v běžné moderní angličtině, ne častěji.

Teorie, kterou ponechalo vlastní testování Goedeckeho v platnosti, ukazuje na změnu trénovacích dat mezi verzemi modelu. Zjistil, že se tento zvyk vyskytuje v odpovědích GPT-3.5 jen sotva, a poté je zhruba desetkrát častější po vydání GPT-4o, což ukazuje spíše na to, co se změnilo v trénovací sadě, než na samotnou architekturu modelu. Jeho nejlepší odhad jsou digitalizované knihy z konce 1800s a počátku 1900s, tedy z období, kdy byl tento znak v tištěné angličtině neobvykle častý, výrazně nad úrovní, na níž se vyskytuje v současném psaní. Nikdo mimo laboratoře, které tyto modely trénovaly, to nemůže potvrdit. Jde o nejpečlivěji otestovanou dostupnou teorii, nikoli o ustálený fakt.

Samostatná výzkumná linie zveřejněná v březnu 2026 ukazuje na související příčinu, kterou stojí za to pojmenovat, totiž na to, jak velká část trénovacího textu modelu byla formátována v markdownu, nikoli jako prostá próza, s předpokladem, že silná expozice tomuto formátovacímu stylu zanechává vlastní otisk na volbě interpunkce obecně. Poctivé shrnutí zní, že několik vysvětlení je pravděpodobných, jedno je poměrně dobře otestované a žádné není potvrzeno tou stranou, která by je skutečně potvrdit mohla.

Jakou úlohu plní znak ve větě?

Než zvolíte náhradu, pomůže pojmenovat úlohu, kterou znak ve větě plní, protože čárka, dvojtečka a tečka nejsou zaměnitelné, a totéž platí pro jejich náhrady v podobě dlouhé pomlčky. Čtyři úlohy pokrývají téměř každý případ, na který může čtenář narazit.

Co značka děláCo místo toho používá lidský autorPříklad
Odděluje vedlejší poznámku uvnitř větyDvojici čárek nebo závorkyZjištění, zopakované dvakrát, platilo za obou podmínek.
Označuje prudký obrat nebo ostré přerušeníTečku a novou větuZjištění platilo za obou podmínek. Nepřežilo třetí.
Spojuje dvě úzce související samostatná tvrzeníTečku, nebo středník tam, kde na spojení záležíVzorek byl malý. Velikost efektu nebyla.
Uvádí seznam, shrnutí nebo vysvětleníDvojtečkuVýsledek ukazoval jedním směrem: replikace selhala.

Každá z těchto vět byla větou, v níž se značka mohla použít, ale nepoužila se. Tento text je sám o sobě argumentem, že značka je strojový příznak, a tento argument předkládá tím, že nikdy nepoužije znak, který popisuje, ani jednou, v žádné větě výše ani níže.

Zlidštit vlastní práci

Proměňte svůj text s pomocí AI a nechte ho znít lidsky, aniž byste zasahovali do důležitých slov nebo citací.

Začít zdarma

Je návyk na em dash u každého chatbota stejný?

Ne, a rozdíl mezi systémy je velký. Test se stejným zadáním napříč šesti chatboty v polovině roku 2025, citovaný v širším průvodci TextPulse k vzorům psaní AI, zjistil, že tři systémy vytvářely tuto značku zhruba jednou za sedmdesát slov a jeden zhruba jednou za čtyři sta sedmdesát, zatímco dva další ji ve vzorku nevytvořily vůbec. Frekvence je vlastností konkrétního systému a verze, které vytvořily odstavec před vámi, nikoli pevnou vlastností psaní AI obecně.

OpenAI v listopadu 2025 vydala částečnou opravu, nastavení vlastních instrukcí, které, jakmile je uživatel zapne, řekne modelu, aby přestal. Sam Altman to oznámil osobně a rámoval to jako konečné vyslyšení dlouhodobé stížnosti. Toto nastavení je volitelné, nikoli výchozí, takže obrovské množství běžného výstupu ChatGPT se ho nikdy nedotklo a tento návyk přetrvává všude tam, kde nikdo neobtěžoval přepnout přepínač.

Pověst tohoto znaménka jako ukazatele AI je sama o sobě poměrně nedávná a poněkud přehnaná. Podle komentářů, které tento vývoj sledovaly, začal odpor kolem února 2025. Jeden populární text o tomto trendu upozornil, že nikdy neexistoval pevný důkaz, že chatboti používají toto znaménko častěji, než to už dělali pečliví lidští autoři. Obě věci mohou platit současně, tento zvyk je skutečný a měřitelný v hrubém výstupu, ale jistota internetu, že jej lze rozpoznat z jediné věty, je daleko před skutečnými důkazy.

Jak zkontrolovat vlastní návrh na tento zvyk

Přečtěte si odstavec nahlas a označte každé místo, kde se objeví dlouhá pomlčka. Jeden výskyt na stránce je stylistická volba, jakou lidští autoři dělají po staletí. Několik výskytů v jednom odstavci, zejména pokud plní různé funkce odlišné od tabulky výše, stojí za druhé posouzení. Taková hustota je mimo výstup AI a mimo několik málo záměrně na pomlčky bohatých stylistů neobvyklá.

Bezplatný odstraňovač em pomlček od TextPulse tuto hustotu kontroluje automaticky a navrhuje čárku, dvojtečku, tečku nebo přepracování, které si každý jednotlivý výskyt žádá, což je rychlejší než ruční počítání v dlouhém dokumentu. Stejná sbírka bezplatných nástrojů pokrývá i další úrovně, které strojově napsaný odstavec obvykle signalizuje současně, volbu slov, rytmus vět a strukturu, pro kontrolu, která jde nad rámec samotné interpunkce.

Výplňové fráze dělají tutéž práci na úrovni věty a existuje seznam těch, které stojí za to odstranit jako první. Odstranění této slovní zásoby z návrhu, který jste už napsali, vyžaduje opět jiný přístup.

K ověření toho nebyl potřeba žádný speciální software, jen pozornost a ochota přečíst větu znovu. Tento text učinil stejnou volbu po celou dobu svého vlastního psaní, sáhnout po čárce, dvojtečce nebo tečce, a ani jednou po znaménku, které po patnácti stech slovech popisoval.

XLinkedInFacebook

Často kladené otázky

Zvyk ChatGPT používat em dash vyplývá hlavně z toho, co se změnilo v trénovacích datech mezi verzemi modelu, nikoli z vědomého návrhu. Nezávislé testování zjistilo, že se toto znaménko v odpovědích GPT-4o objevuje mnohem častěji než v GPT-3.5, a přední teorie ukazuje na silnou expozici starším tištěným knihám z období, kdy se toto znaménko používalo nezvykle často. OpenAI nezveřejnila vlastní vysvětlení, takže jde stále o nejlépe podloženou teorii, nikoli o potvrzený fakt.

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.