Portál | Český národní korpus

Co je to korpus?

Jazykový korpus je elektronický soubor autentických textů (psaných nebo mluvených), v němž je možné jednoduše vyhledávat jazykové jevy (zejm. slova a slovní spojení) a zobrazovat je v jejich přirozeném kontextu.

Korpusy ČNK zahrnují vedle psaného současného jazyka (v rozsahu přes 4 mld. slov) i soubory spontánního mluveného jazyka (přes 7 mil. slov), diachronní korpus starších textů a paralelní korpus InterCorp obsahující překlady z nebo do více než 30 jazyků.

více…

Aplikace

Aplikace KonText je základním nástrojem pro práci s korpusy. Umožňuje vyhledávání v korpusech pomocí jednoduchých i komplexních dotazů, zobrazení formou konkordančních řádků, vypočtení frekvenční distribuce, asociačních měr kolokací a další práci s jazykovými daty. Přehledně jsou všechny funkce KonTextu popsány v manuálu.

přejít na KonText →
Nástroj SyD je určen pro všestranný průzkum variant jak v současném jazyce, tak v průběhu jeho vývoje. Využívá korpusů ČNK, s jejichž pomocí zjišťuje, jak často se která varianta užívá v současnosti a užívala v průběhu vývoje češtiny. Pro jeho vyzkoušení stačí zadat dvě varianty jednoho jevu, které si vzájemně konkurují, např. téměř × skoro.

přejít na SyD →
Nástroj Morfio slouží pro vyhledávání slovotvorných vztahů mezi jednotkami v korpusech, např. lovit - úlovek. Umožňuje najít všechny dvojice slov tvořené stejným způsobem a vyhodnotit morfologickou produktivitu jejich tvoření. Aplikace využívá rozsáhlých korpusů psaného jazyka, které pokrývají širokou paletu slovotvorných možností současné češtiny.

přejít na Morfio →
Aplikace KWords poskytuje základní východisko pro empiricky podloženou interpretaci textů tím, že analyzuje slova v zadaném textu a porovnává jejich frekvenci s referenčním korpusem. Výsledkem takové analýzy je identifikace klíčových slov, tj. jednotek vyskytujících se signifikantně častěji v analyzovaném textu než v korpusu, který představuje neutrální jazykový úzus.

přejít na KWords →
Aplikace umožňuje snadné vyhledávání překladových ekvivalentů v oboustranných česko-cizojazyčných slovnícícch vytvořených automaticky na základě dat paralelního korpusu InterCorp.

přejít na Treq →

další aplikace…

Kdo jsme?

Český národní korpus je akademický projekt založený v roce 1994 při FF UK a spravovaný Ústavem Českého národního korpusu. Jeho cílem je systematicky mapovat češtinu a další jazyky ve srovnání s ní. Korpusy ČNK jsou po bezplatné registraci otevřeny všem zájemcům o jazyk, kteří touží vědět, jak se čeština používá.

více…

KonText: verze 0.18

SYN verze 12

Korpus OnomOs

KWords 2

Projekt HiČKoK

InterCorp verze 16

DOTKO v2

Mapka verze 2.0

Korpus Totalita

KonText: verze 0.17

Žalm 77

Česko-slovenské slovo týdne