Přeskočit na obsah
Nešiř to
Rubriky ▾
Nahlásit chybu
Čísla

Novinářská kachna je v tisku doložená od roku 1870, vrchol v roce 2009 dělá digitalizace

Spočítali jsme, na kolika stránkách českých novin a knih stojí spojení „novinářská kachna“. Vyšlo 1 357 stránek a nejstarší je z 13. února 1870. Syrový počet má vrchol v roce 2009 – jenže po přepočtu na to, kolik stránek z kterého roku je vůbec naskenováno, je rok 2009 podprůměrný. Ukazujeme celý postup i to, kde se dá touhle cestou snadno vyrobit graf, který neříká nic.

Verdikt
rozbor bez verdiktu
Ověřeno
14. 7. 2026

Čeština má pro vymyšlenou zprávu vlastní slovo, které je starší než rozhlas, televize i internet: novinářská kachna. Kdy se v tisku objevilo a jestli ho novější výrazy vytlačují, nikdo nepočítá. Spočítali jsme to z fulltextu digitální knihovny Kramerius Moravské zemské knihovny, která má přes 76 milionů naskenovaných stránek novin a knih. Čísla níž jsou ke 31. červenci 2026 a jsou naše, ta knihovna je nikde nezveřejňuje.

Zajímavější než výsledek je cesta k němu. Táž databáze odpoví na tutéž otázku třemi způsoby podle toho, kde počítání zastavíte – a dvě z těch tří odpovědí jsou špatně.

Kachna divoká plave na vodní hladině pokryté drobným okřehkem
Kachna divoká na hladině s okřehkem. Foto: H. Zell, Wikimedia Commons (CC BY-SA 3.0)

Odkud čísla jsou

Kramerius Moravské zemské knihovny má otevřené vyhledávací rozhraní bez přihlášení a bez klíče. Dotaz do pole text_ocr hledá v textu rozpoznaném ze skenů, filtr model:page omezí odpověď na stránky a seskupení podle date.min je rozloží po letech vydání. Základ korpusu je 76 260 467 stránek a řada sahá do roku 1841.

Fráze "novinářská kachna" je na 1 357 stránkách. U čtyř z nich chybí rok, takže se do řady po letech dostane 1 353; ve všech počtech níž ty čtyři nejsou. Hledá se přesný tvar, ne slovo se všemi jeho pády: samotné „novinářské kachny“ je dalších 725 stránek a do naší řady nespadají. Nepočítáme tedy, jak často se o novinářských kachnách psalo, ale jak často padla jedna konkrétní podoba toho spojení.

Nejstarší nález: říšská rada, únor 1870

Nejstarší stránka s tou frází je první strana Národních listů z neděle 13. února 1870. Je ve zprávě z jednání říšské rady o bezpečnosti na venkově. List o interpelujícím poslanci píše doslova, že „zdá se mu, že veškeré zprávy o prostředcích proti vloupání se a krádežím jsou novinářská kachna“ – je to tedy shrnutí zpravodaje, ne přepis poslancových slov. Přepis je z textu rozpoznaného ze skenu, stránku si lze prohlédnout. Výraz v ní není nijak vysvětlovaný, takže už tehdy byl čtenářům srozumitelný. Jeho vznik je starší než tenhle doklad, jen do korpusu nespadá.

Že jde o ustálený význam, a ne o jednorázový obrat, potvrzuje nezávisle Slovník spisovného jazyka českého Ústavu pro jazyk český. Třetí význam hesla kachna zní: nepravdivá, vymyšlená, senzační zpráva – a jako příklad uvádí právě novinářskou kachnu.

Odpověď první, špatná: vrchol je rok 2009

Kdo se zastaví u syrového počtu, dostane jasnou křivku s vrcholem v posledních letech:

rokstránek s frází
200943
200835
200234
199327
201027

Z toho by plynulo, že spojení bylo nejživější kolem roku 2009. Jenže tenhle počet měří něco jiného, než se zdá: měří, na kolika naskenovaných stránkách fráze je. A skenuje se nerovnoměrně.

Odpověď druhá, lepší: přepočet na objem digitalizace

Kolik stránek z kterého roku knihovna vůbec má, vydá tentýž dotaz bez hledaného slova. Z roku 1870 je v korpusu 42 898 stránek, z roku 2009 jich je 2 381 896 – pětapadesátkrát víc. Podíl na milion stránek daného období pak vypadá takhle:

desetiletístránek s frázístránek celkemna milion
1870–187910465 24921,5
1900–1909361 945 91818,5
1930–1939793 681 31021,5
1960–19691045 265 43519,8
1970–19791355 528 59024,4
1990–19992019 712 90220,7
2000–200927317 000 12616,1
2010–20191148 393 43113,6

Vrchol z první tabulky zmizel: rok 2009 je po přepočtu podprůměrný. Řada je naopak pozoruhodně plochá – sto padesát let se drží kolem dvaceti stránek z milionu. Po jednotlivých letech se počítat nedá vůbec: v devatenáctém století jsou to jednotky nálezů ročně a jediná stránka navíc s takovým číslem zamává o desítky procent.

Odpověď třetí: jmenovatel v čase mění povahu

I ten přepočet ale pořád srovnává nesrovnatelné. Korpus totiž není tisk. Z celých 76 milionů stránek pochází 15,8 milionu z periodik a 59,6 milionu z knih – a ten poměr se v čase láme:

desetiletípodíl periodik v korpusu
1890–189962,4 %
1920–192933,3 %
1950–195913,1 %
2000–20099,5 %
2020–202959,8 %

Devatenácté století je v téhle knihovně z větší části tisk, druhá polovina dvacátého století skoro celá knihy. Otázka „jak často to psaly noviny“ se proto musí ptát jen novin. Se stejným filtrem na obou stranách zlomku zbude 476 stránek a řada, která konečně měří jednu věc:

desetiletív periodikáchstránek periodikna milion
1870–187910252 91839,5
1900–1909351 060 15233,0
1930–1939541 334 34640,5
1950–19597557 44212,6
1960–196946891 14351,6
1990–1999621 383 32344,8
2000–2009321 615 34519,8
2010–2019381 830 52920,8

Teprve tady je vidět něco, co první tabulka popírala: v novinách bylo spojení nejhustší v šedesátých letech a po roce 2000 kleslo zhruba na polovinu. Syrový počet přitom ve stejné době rostl.

Kontrola vzorkem, bez které to nemá cenu

Počet z fulltextu není počet užití. Rozpoznávání textu ze skenů chybuje a knihovna obsahuje i slovníky, sbírky rčení a knihy o původu slov, kde je fráze heslem, ne zprávou. Otevřeli jsme proto vzorky.

U novinářské kachny mezi lety 1960 a 1980 jsou v prvních deseti nálezech čtyři vydání polsko-českého kapesního slovníku a knížka o původu rčení; z let 2000 až 2011 vede vzorek na Kuchařku plzeňských strašidel, cvičebnici češtiny a knihu o optických iluzích. Právě proto je řada omezená na periodika ta jediná použitelná – a právě proto je u ní číslo za nejnovější desetiletí, kde korpus obsahuje jen 472 551 stránek periodik, spíš orientační.

Nejnázorněji to ukazuje kontrolní dotaz na slovo hoax. Ve fulltextu je na 1 745 stránkách a 98 z nich je z let 1960 až 1980, což by znamenalo, že se to slovo v Československu používalo dávno před internetem. Vzorek ale vydá Cvičebnici jazyka řeckého, dvě vydání anglicko-českého slovníku a příručku Údržba a opravy vozů Škoda 100. Jsou to slovníková hesla a chyby rozpoznávání, ne doklad o češtině. Kdo by ta čísla vzal tak, jak přišla, vyrobil by graf, ze kterého by plynul nesmysl – a vypadal by přesně jako ten náš.

Nahrazuje kachnu dezinformace?

S výhradou z předchozího oddílu, tedy nad celým korpusem včetně knih a jen jako hrubé měřítko, vypadá souběh tří výrazů takhle (stránek na milion):

desetiletínovinářská kachnahoaxdezinformace
1960–196919,88,217,1
1980–198921,19,6126,2
2000–200916,139,2141,5
2010–201913,656,8216,0

Sloupec s hoaxem je do devadesátých let z větší části slovníkový a OCR šum, jak je popsáno výš; jeho růst po roce 2000 je ale příliš velký na to, aby ho vysvětlily chyby. Slovo dezinformace roste rychleji než obě ostatní dohromady. Novinářská kachna nezmizela, jen ji ostatní přerostly.

Co z toho neplyne

Řada neměří, jak lidé mluvili – měří, co je naskenované. Neměří ani, kolik vymyšlených zpráv opravdu vyšlo; to je stejná past, jakou má počet záznamů v databázi hlášení. A protože Kramerius Moravské zemské knihovny je jedna knihovna z několika, jiná digitalizace by dala jiná čísla; u sbírky na HOAX.cz jsme viděli totéž z druhé strany – dva veřejné výpisy téhož archivu nedaly stejný počet.

Co z toho plyne, je jediná věta: když někdo ukáže graf výskytu slova v čase, první otázka nemíří na křivku, ale na jmenovatel. Bez něj je to graf digitalizace.

Zdroje a odkazy

Našli jste v záznamu chybu?

Napište, o který záznam jde, co je v něm špatně a z čeho to plyne formulářem na stránce o opravách. Odpovídáme do sedmi dnů a provedené opravy vedeme veřejně.

Sdílet: Facebook · X · e-mailem · RSS

Dál k tématu

Pochybnou zprávu na internetu si v Česku ověřuje menší část lidí než v průměru unie

Eurostat má v otevřené databázi výsledky šetření o používání internetu za rok 2025. Nepravdivou nebo pochybnou zprávu na zpravodajském webu nebo sociální síti vidělo v Česku 68 % uživatelů internetu, ověřovalo si ji 27 %; v průměru unie je to 60 a 31 %. Spočítali jsme pořadí Česka mezi 27 státy, vývoj od roku 2021 a za skokem v důvodech neověřování našli změnu českého dotazníku.

Čísla

zavádějící

Číslo o rakovině po 11. září sčítá certifikace za celou dobu zdravotního programu

Web Necenzurovaná pravda vydal 2. září překlad americké zprávy o tom, že rakovina u lidí z okolí newyorského Světového obchodního centra vzrostla o víc než čtyři tisíce procent. Čísla ve zprávě opravdu pocházejí z veřejných přehledů amerického zdravotního programu, jenže ten sčítá certifikace za celou dobu své existence a členů mu za deset let přibylo dvakrát tolik. Prošli jsme šest jeho čtvrtletních přehledů od roku 2016 a spočítali, co z toho nárůstu je růst samotného programu.

Čísla

zavádějící

Lůžka navíc má Česko v dlouhodobé péči, v akutní je na evropském mediánu

Po nedělním rozhovoru prezidenta na CNN Prima NEWS se na sítích rozběhly příspěvky, které z jeho slov dělají ohlášené rušení nemocnic. Manipulátoři je označili za zavádějící. Rozebrali jsme k tomu evropská data o lůžkách, protože prezidentova výhrada mířila na skladbu péče, ne na celkový počet: akutních lůžek má Česko přesně tolik co medián devatenácti zemí unie, zato lůžek dlouhodobé péče uvnitř nemocnic nejvíc z nich.

Čísla

zavádějící

Evropa měla v roce 1913 necelou polovinu světového HDP

Rozhovor vydaný 28. srpna staví proti sobě sedmdesát procent světového HDP v roce 1913 a šestnáct procent dnes. Když se ten podíl přepočítá z Maddisonovy databáze, vychází Evropě za rok 1913 necelá polovina. Sedmdesáti procent dosáhne teprve dohromady se Spojenými státy, Kanadou, Austrálií a Novým Zélandem.

Čísla