Přeskočit na obsah
Nešiř to
Rubriky ▾
Nahlásit chybu
Čísla

Novinářská kachna je v tisku doložená od roku 1870, vrchol v roce 2009 dělá digitalizace

Spočítali jsme, na kolika stránkách českých novin a knih stojí spojení „novinářská kachna“. Vyšlo 1 357 stránek a nejstarší je z 13. února 1870. Syrový počet má vrchol v roce 2009 – jenže po přepočtu na to, kolik stránek z kterého roku je vůbec naskenováno, je rok 2009 podprůměrný. Ukazujeme celý postup i to, kde se dá touhle cestou snadno vyrobit graf, který neříká nic.

Verdikt
rozbor bez verdiktu
Ověřeno
31. 7. 2026

Čeština má pro vymyšlenou zprávu vlastní slovo, které je starší než rozhlas, televize i internet: novinářská kachna. Kdy se v tisku objevilo a jestli ho novější výrazy vytlačují, nikdo nepočítá. Spočítali jsme to z fulltextu digitální knihovny Kramerius Moravské zemské knihovny, která má přes 76 milionů naskenovaných stránek novin a knih. Čísla níž jsou ke 31. červenci 2026 a jsou naše, ta knihovna je nikde nezveřejňuje.

Zajímavější než výsledek je cesta k němu. Táž databáze odpoví na tutéž otázku třemi způsoby podle toho, kde počítání zastavíte – a dvě z těch tří odpovědí jsou špatně.

Kachna divoká plave na vodní hladině pokryté drobným okřehkem
Kachna divoká na hladině s okřehkem. Foto: H. Zell, Wikimedia Commons (CC BY-SA 3.0)

Odkud čísla jsou

Kramerius Moravské zemské knihovny má otevřené vyhledávací rozhraní bez přihlášení a bez klíče. Dotaz do pole text_ocr hledá v textu rozpoznaném ze skenů, filtr model:page omezí odpověď na stránky a seskupení podle date.min je rozloží po letech vydání. Základ korpusu je 76 260 467 stránek a řada sahá do roku 1841.

Fráze "novinářská kachna" je na 1 357 stránkách. U čtyř z nich chybí rok, takže se do řady po letech dostane 1 353; ve všech počtech níž ty čtyři nejsou. Hledá se přesný tvar, ne slovo se všemi jeho pády: samotné „novinářské kachny“ je dalších 725 stránek a do naší řady nespadají. Nepočítáme tedy, jak často se o novinářských kachnách psalo, ale jak často padla jedna konkrétní podoba toho spojení.

Nejstarší nález: říšská rada, únor 1870

Nejstarší stránka s tou frází je první strana Národních listů z neděle 13. února 1870. Je ve zprávě z jednání říšské rady o bezpečnosti na venkově. List o interpelujícím poslanci píše doslova, že „zdá se mu, že veškeré zprávy o prostředcích proti vloupání se a krádežím jsou novinářská kachna“ – je to tedy shrnutí zpravodaje, ne přepis poslancových slov. Přepis je z textu rozpoznaného ze skenu, stránku si lze prohlédnout. Výraz v ní není nijak vysvětlovaný, takže už tehdy byl čtenářům srozumitelný. Jeho vznik je starší než tenhle doklad, jen do korpusu nespadá.

Že jde o ustálený význam, a ne o jednorázový obrat, potvrzuje nezávisle Slovník spisovného jazyka českého Ústavu pro jazyk český. Třetí význam hesla kachna zní: nepravdivá, vymyšlená, senzační zpráva – a jako příklad uvádí právě novinářskou kachnu.

Odpověď první, špatná: vrchol je rok 2009

Kdo se zastaví u syrového počtu, dostane jasnou křivku s vrcholem v posledních letech:

rokstránek s frází
200943
200835
200234
199327
201027

Z toho by plynulo, že spojení bylo nejživější kolem roku 2009. Jenže tenhle počet měří něco jiného, než se zdá: měří, na kolika naskenovaných stránkách fráze je. A skenuje se nerovnoměrně.

Odpověď druhá, lepší: přepočet na objem digitalizace

Kolik stránek z kterého roku knihovna vůbec má, vydá tentýž dotaz bez hledaného slova. Z roku 1870 je v korpusu 42 898 stránek, z roku 2009 jich je 2 381 896 – pětapadesátkrát víc. Podíl na milion stránek daného období pak vypadá takhle:

desetiletístránek s frázístránek celkemna milion
1870–187910465 24921,5
1900–1909361 945 91818,5
1930–1939793 681 31021,5
1960–19691045 265 43519,8
1970–19791355 528 59024,4
1990–19992019 712 90220,7
2000–200927317 000 12616,1
2010–20191148 393 43113,6

Vrchol z první tabulky zmizel: rok 2009 je po přepočtu podprůměrný. Řada je naopak pozoruhodně plochá – sto padesát let se drží kolem dvaceti stránek z milionu. Po jednotlivých letech se počítat nedá vůbec: v devatenáctém století jsou to jednotky nálezů ročně a jediná stránka navíc s takovým číslem zamává o desítky procent.

Odpověď třetí: jmenovatel v čase mění povahu

I ten přepočet ale pořád srovnává nesrovnatelné. Korpus totiž není tisk. Z celých 76 milionů stránek pochází 15,8 milionu z periodik a 59,6 milionu z knih – a ten poměr se v čase láme:

desetiletípodíl periodik v korpusu
1890–189962,4 %
1920–192933,3 %
1950–195913,1 %
2000–20099,5 %
2020–202959,8 %

Devatenácté století je v téhle knihovně z větší části tisk, druhá polovina dvacátého století skoro celá knihy. Otázka „jak často to psaly noviny“ se proto musí ptát jen novin. Se stejným filtrem na obou stranách zlomku zbude 476 stránek a řada, která konečně měří jednu věc:

desetiletív periodikáchstránek periodikna milion
1870–187910252 91839,5
1900–1909351 060 15233,0
1930–1939541 334 34640,5
1950–19597557 44212,6
1960–196946891 14351,6
1990–1999621 383 32344,8
2000–2009321 615 34519,8
2010–2019381 830 52920,8

Teprve tady je vidět něco, co první tabulka popírala: v novinách bylo spojení nejhustší v šedesátých letech a po roce 2000 kleslo zhruba na polovinu. Syrový počet přitom ve stejné době rostl.

Kontrola vzorkem, bez které to nemá cenu

Počet z fulltextu není počet užití. Rozpoznávání textu ze skenů chybuje a knihovna obsahuje i slovníky, sbírky rčení a knihy o původu slov, kde je fráze heslem, ne zprávou. Otevřeli jsme proto vzorky.

U novinářské kachny mezi lety 1960 a 1980 jsou v prvních deseti nálezech čtyři vydání polsko-českého kapesního slovníku a knížka o původu rčení; z let 2000 až 2011 vede vzorek na Kuchařku plzeňských strašidel, cvičebnici češtiny a knihu o optických iluzích. Právě proto je řada omezená na periodika ta jediná použitelná – a právě proto je u ní číslo za nejnovější desetiletí, kde korpus obsahuje jen 472 551 stránek periodik, spíš orientační.

Nejnázorněji to ukazuje kontrolní dotaz na slovo hoax. Ve fulltextu je na 1 745 stránkách a 98 z nich je z let 1960 až 1980, což by znamenalo, že se to slovo v Československu používalo dávno před internetem. Vzorek ale vydá Cvičebnici jazyka řeckého, dvě vydání anglicko-českého slovníku a příručku Údržba a opravy vozů Škoda 100. Jsou to slovníková hesla a chyby rozpoznávání, ne doklad o češtině. Kdo by ta čísla vzal tak, jak přišla, vyrobil by graf, ze kterého by plynul nesmysl – a vypadal by přesně jako ten náš.

Nahrazuje kachnu dezinformace?

S výhradou z předchozího oddílu, tedy nad celým korpusem včetně knih a jen jako hrubé měřítko, vypadá souběh tří výrazů takhle (stránek na milion):

desetiletínovinářská kachnahoaxdezinformace
1960–196919,88,217,1
1980–198921,19,6126,2
2000–200916,139,2141,5
2010–201913,656,8216,0

Sloupec s hoaxem je do devadesátých let z větší části slovníkový a OCR šum, jak je popsáno výš; jeho růst po roce 2000 je ale příliš velký na to, aby ho vysvětlily chyby. Slovo dezinformace roste rychleji než obě ostatní dohromady. Novinářská kachna nezmizela, jen ji ostatní přerostly.

Co z toho neplyne

Řada neměří, jak lidé mluvili – měří, co je naskenované. Neměří ani, kolik vymyšlených zpráv opravdu vyšlo; to je stejná past, jakou má počet záznamů v databázi hlášení. A protože Kramerius Moravské zemské knihovny je jedna knihovna z několika, jiná digitalizace by dala jiná čísla; u sbírky na HOAX.cz jsme viděli totéž z druhé strany – dva veřejné výpisy téhož archivu nedaly stejný počet.

Co z toho plyne, je jediná věta: když někdo ukáže graf výskytu slova v čase, první otázka nemíří na křivku, ale na jmenovatel. Bez něj je to graf digitalizace.

Zdroje a odkazy

Našli jste v záznamu chybu?

Napište, o který záznam jde, co je v něm špatně a z čeho to plyne formulářem na stránce o opravách. Odpovídáme do sedmi dnů a provedené opravy vedeme veřejně.

Sdílet: Facebook · X · e-mailem · RSS

Dál k tématu

Demagog ověřil 15 113 výroků politiků. Dvě třetiny vyhodnotil jako pravdivé

Demagog.cz zveřejňuje hodnocení výroků politiků od roku 2012. Z jeho veřejného programového rozhraní vychází, že jich za tu dobu ověřil 15 113 a 10 049 z nich vyhodnotil jako pravdivé. Ročně jich dnes vzniká necelá třetina proti roku 2016 – a spolu s výstupem Manipulátorů z toho u těchhle dvou ověřovatelů vychází necelé dvě položky s verdiktem denně.

Čísla

Do sbírky hoaxů na HOAX.cz tři roky nic nepřibylo. Přírůstky se přesunuly k phishingu

Databáze řetězových hoaxů na HOAX.cz má 304 záznamů a poslední z nich se podle webu poprvé objevil v květnu 2023. Prošli jsme všech 304 položek i archivní snímky výpisu od roku 2008 a obě cesty vedou ke stejnému datu. Web přitom neusnul: nejnovější záznamy z března 2026 jsou v jeho sekcích o phishingu a podvodných nabídkách.

Čísla