Nový formát vzdělávání: Letní škola statistiky 2026
Za 5 dní ovládnete statistiku v R, JASP, nebo Jamovi. Napořád.

20. - 24. 7. 2026
Prohlédnout

Nový webinář ZDARMA:

Google Earth Engine v R – satelitní data bez stahování

středa 9. 9. 2026 od 15:00
Prohlédnout

Objevte nové možnosti využití statistiky pro svou praxi.

Podívejte se na ZÁZNAM WEBINÁŘE Biostatistika v R
Prohlédnout

Obsah

Percentil: definice, využití a výpočet


Percentil je míra polohy, který dělí uspořádaný soubor hodnot na 100 stejně velkých částí. Standardně ukazuje celočíselný podíl (procento) pozorovaní v datové sadě pod určitou hodnotou.

Např. 20. percentil (označovaný jako P20) je hodnota, pod kterou leží 20 % všech pozorování a 80. percentil (P80) je hodnota, pod kterou leží 80 % všech pozorování.

Spolu s dalšími kvantily lze percentil spočítat u ordinálních proměnných a kvantitativních proměnných. U druhé skupiny je výpočet možný za předpokladu rovnoměrného rozložení dat a dostatečného počtu pozorování v každé kategorii (např. u školních známek, kde předpokládáme stejný rozdíl mezi jednotlivými stupni známkování).

Percentil se počítá podle následujícího vzorce (viz příklad níže):

\[ P_k = \frac{(n+1) \cdot k}{100} \]

\(P_k \) označuje pořadí hodnoty k-tého percentilu v souboru vzestupně seřazených dat. \(n \) je počet hodnot v datovém souboru. V praxi se percentily počítáme s pomocí statistických programů.

V případě, že výsledkem není celé číslo, je potřeba výsledek upravit lineární interpolací mezi dvěma sousedními hodnotami v uspořádaném datovém souboru. Její vzorec je následující (viz příklad níže):

\[ y = y_1 + \left( \frac{x – x_1}{x_2 – x_1} \right) \cdot (y_2 – y_1) \]

\( x_1 \) a \( x_2 \) je menší, resp. větší pořadí hodnoty, pro které provádíme interpolaci. \( y_1 \) a \( y_2 \) je pak menší, resp. větší hodnota, které interpolujeme.

Zvýhodněné balíčky kurzů

Zakupte si balíček 2 nebo více vybraných kurzů a ušetřete

Pozor – aplikace pro statistickou analýzu, jako je Excel a jazyk R, nevyužívají pro získání výsledku lineární interpolaci, ale složitější postupy. Výsledky se proto mohou od ručního výpočtu lišit.


Využití percentilů

Percentily jsou dalším z nástrojů pro popis rozložení dat u velkých datových souborů. U normálního rozložení jsou rozestupy mezi percentily od středu podobné (graf výše), zatímco v souborech se zešikmenými daty (viz míry tvaru) se zpravidla výrazně liší – data se koncentrují na jedné straně rozložení:

Spolu s mezikvartilovým rozpětím a dalšími metodami lze percentily použít pro identifikaci odlehlých hodnot. Za extrémní se mohou považovat hodnoty, které leží pod hranicí 5. percentilu (resp. 1. percentilu) a nad hranicí 95. percentilu (resp. 99. percentilu).

Záleží na kontextu – u dat s pravostranným rozložením lze za extrémní brát hodnoty nad 95. percentilem, protože většina dat se nachází napravo od mediánu. Naopak u normálního rozložení je za odlehlé možné považovat hodnoty pod 5. a nad 95. percentilem.

Percentily jsou dobrým ukazatelem pro srovnávání různých datových sad. Předpokladem je:

  • podobné rozdělení (distribuce) datových sad,
  • měření na stejné nebo srovnatelné škále,
  • dostatečná velikost vzorku (za účelem reprezentace dané populace).

Používají se např. pro porovnání znalostí studentů v různých státech nebo míry znečištění v různých regionech. Ve zdravotnictví a dalších oborech slouží percentily pro stanovení norem:

Použití percentilů není vhodné pro:

  • malé datové sady (méně než několik desítek hodnot),
  • výrazně odlišná distribuce srovnávaných datových sad (např. sada hodnot s normálním rozdělením a sada hodnot s výrazně levostrannou distribucí),
  • pro datové sady s vysokým počtem odlehlých hodnot.


Příklad výpočtu percentilů

Vaším úkolem je spočítat 20. a 80. percentil výšky tříletých dívek z následujících dat: 90, 95, 88, 92, 89, 94, 97, 86, 99, 85, 93, 96, 100, 91, 87, 98, 94, 92 a 90 cm. (Jde o ilustrační příklad – pro takto malou datovou sadou není vhodné percentil používat.)

Hodnoty nejprve vzestupně seřadíme:

Pořadí hodnoty 1 2 3 4 5 6 7 8 9 10
Výška (cm) 85 86 87 88 89 90 90 91 92 92
Pořadí hodnoty 11 12 13 14 15 16 17 18 19
Výška (cm) 93 94 94 95 96 97 98 99 100


Pro výpočet 20. percentilu z 19 hodnot dosadíme příslušné hodnoty do výše uvedené rovnice:

\[P_k = \frac{(n+1) \cdot k}{100}\] \[P_{20} = \frac{(19+1) \cdot 20}{100}\] \[P_{20} = 4\]

20. percentil (P20) odpovídá v této sadě 4. hodnotě, tedy výšce 88 cm. V dané datové sadě je tedy 20 % dívek vysokých 88 cm (nebo menších).

Stejným způsobem spočítáme i 80. percentil:

\[P_{80} = \frac{(19+1) \cdot 80}{100}\] \[P_{20} = 16\]

80. percentil (P80) odpovídá 16. hodnotě, výšce 97 cm. V dané sadě dosahuje 80 % dívek výšky maximálně 97 cm.



Příklad výpočtu percentilů s lineární interpolací

Vyjdeme ze stejných dat jako v předchozím příkladu, přidáme pouze navíc jednu hodnotu (106 cm). V datovém souboru bude tedy 20 hodnot:

Pořadí hodnoty 1 2 3 4 5 6 7 8 9 10
Výška (cm) 85 86 87 88 89 90 90 91 92 92
Pořadí hodnoty 11 12 13 14 15 16 17 18 19 20
Výška (cm) 93 94 94 95 96 97 98 99 100 106


Hodnoty dosadíme do vzorce pro výpočet 20. percentilu:

\[P_k = \frac{(n+1) \cdot k}{100}\] \[P_{20} = \frac{(20+1) \cdot 20}{100}\] \[P_{20} = 4.2\]

Pořadí číslo 4,2 (\( x \)) neexistuje. Provedeme proto lineární interpolaci mezi hodnotami na 4. a 5. místě (\( x_1 \) a \( x_2 \)). Tyto hodnoty (88 a 89 cm, tedy \( y_1 \) a \( y_2 \)) dosadíme do příslušného vzorce (viz výše):

\[ y = y_1 + \left( \frac{x – x_1}{x_2 – x_1} \right) \cdot (y_2 – y_1) \] \[ y = 88 + \left( \frac{4.2 – 4}{5 – 4} \right) \cdot (89 – 89) \] \[ y = 88.2 \]

Hodnota 20. percentilu se tedy rovná 88,2 cm. Stejným postupem získáme u 80. percentilu k (neexistujícímu) pořadí 16,8. Po použití lineární interpolace nám vyjde hodnota 80. percentilu 97,8 cm.



Výpočet percentilů v Excelu

# buňky A1 až A100 obsahují naměřené hodnoty

# funkce pro výpočet percentilů
=PERCENTILE.INC(A1:A100, 0.05)  # pro výpočet P5
=PERCENTILE.INC(A1:A100, 0.2)  # pro výpočet P20
=PERCENTILE.INC(A1:A100, 0.8)  # pro výpočet P80
=PERCENTILE.INC(A1:A100, 0.95)  # pro výpočet P95


Výpočet percentilů v jazyce R

# naměřené hodnoty
data <- c(3, 5, 6, 7, 8)

# funkce pro výpočet percentilů P5, P20, P80 a P95
quantile(data, probs = c(0.05, 0.2, 0.8, 0.95))

# funkce pro výpočet percentilů P5, P20, P80 a P95 lineární interpolací
quantile(data, probs = c(0.05, 0.2, 0.8, 0.95), type = 6)


Mohlo by vás zajímat

Články
Analýza dat ve vědě a výzkumu

Statistická analýza je klíčem ke kvalitnějším výsledkům a publikaci v prestižních vědeckých časopisech. Jak ji dělat správně?

Naše kurzy

Python pro datovou analýzu: pandas a vizualizace za 2 dny

Přihlásit na kurz Lektor: Mgr. Bc. Silvie Bělašková, Ph.D. Trvání kurzu: 2 dny Naučte se ovládat programovací jazyk Python pro účely analýzy analýzy dat – s pomocí knihovny pandas a aplikace Jupyter Notebook, které práci v Pythonu výrazně zjednodušují. Po absolvování kurzu zvládnete v Pythonu data načíst, zpracovat, analyzovat, vizualizovat a a získané výsledky sdílet se svými kolegy. Získané znalosti ihned uplatníte ve své vědecké práci. Kurzem vás provede vás provede… (viz profil lektora). Všechny prezentované postupy si vyzkoušíte na praktických příkladech v anglické verzi Pythonu a aplikace Jupyter Notebook. Počítač vám zapůjčíme na místě, není třeba nosit vlastní.   Chci se přihlásit Adresa konání kurzu Délka kurzu Z kurzu budete mít největší užitek, pokud: se chcete naučit ovládat programovací jazyk Python pro vyhodnocování dat ze svého výzkumu, máte s Pythonem zkušenosti, ale potřebujete si oživit základy nebo se chcete k výsledkům dostat rychleji. Jaké vstupní znalosti jsou potřeba? pro absolvování kurzu nejsou potřeba žádné specifické znalosti Co se na kurzu naučíte? orientovat se v prostředí Pythonu, knihovny pandas a aplikace Jupyter Notebooks a importovat do nich vlastní datové soubory, pracovat v pandas s datovými tabulkami (dataframes), spojit je a vyhledat v nich potřebná data, filtrovat data, upravit je (včetně doplnění chybějících hodnot) a vyhodnotit, vizualizovat data v knihovně pandas, tvořit vlastní datové modely a testovat je. Chci vidět podrobný sylabus kurzu Základy Pandas a Jupyter notebooku Seznámení s Pythonem Seznámení s knihovnou Pandas Seznámení s Jupyter notebookem Instalace Pythonu, Jupyter notebooku a knihovny Pandas Seznámení s dalšími Python knihovnami Ukázka práce s knihovnou Pandas Základní práce s datovou tabulkou Pandas Seznámení s knihovnou Pandas Vysvětlení pojmů dataframe Vytvoření a načtení dataframe Praktické metody pro zobrazení dataframu Hledání dat a filtrování Grupování a filtrování Práce s daty Datové typy Chybějící data Přejmenování dat Spojování tabulek Vizualizace dat v prostředí Pandas Tvorba základních grafů Tvorba základních grafů Seznámení s vizualizačními knihovnami Investigace vlastních dat Import vlastního datasetu Metody investigace dat Vizualizace a interpretace dat Experimentování Pomoc Pandas dokumentace Pomoc ChatGPT Tvorba modelu nad vlastními daty Import vlastního datasetu Definování use case Příprava dat Volba modelu Testování modelu Názory spokojených účastníků „Lékaři zabývající se praktickou medicínou věříí, že argumentace pocházející z oblasti tzv. medicíny založené na důkazech obsahuje úplné informace z přesného a správného zpracování dat definovaných zdrojů. Každý z nás se musí vyrovnat s interpretací těchto dat. K tomu je velmi užitečné umět posoudit vztah mezi statistickou významností a praktickou důležitostí

Geodata v R: mapy a prostorové analýzy hromadně

Přihlásit na kurz Lektor: Mgr. Ondřej Ledvinka, PhD. Trvání kurzu: 2 dny Naučte se od základu vyhodnocovat geoprostorová data (geodata) v programovacím jazyce R pomocí funkcí, které jejich hromadné zpracování zjednodušují a urychlují. V kurzu pro vědecké pracovníky z oblasti geověd vás naučíme, jak geodata zpracovat a transformovat na tzv. tidy formát i jak je analyzovat a vizualizovat (tvořit mapy). Po absolvování školení tak zvládnete rychle vytvořit analytické skripty pro geodata. 2denním kurzem vás provede Mgr. Ondřej Ledvinka, PhD., specialista Oddělení hydrofondu a bilancí ČHMÚ a odborný asistent Katedry fyzické geografie a geoekologie Univerzity Karlovy, který se zpracování geodat věnuje v oblasti hydrologie a klimatologie (viz profil lektora). Procvičování probíhá v anglické verzi aplikace RStudio. Počítač vám zapůjčíme na místě, není třeba nosit vlastní. Po skončení kurzů navíc získáte přes 40 skriptů, které použijete k analýze vlastních dat. Chci se přihlásit Adresa konání kurzu Délka kurzu Z kurzu budete mít největší užitek, pokud: se chcete naučit ovládat programovací jazyk R pro vyhodnocování dat, jejichž nedílnou součástí je geometrie (vektorová geodata, rastrová geodata), nemáte se zpracováním geodat v jazyce R žádné zkušenosti a potřebujete jejich analýzu využívat ve své práci (výzkumní pracovníci z oblasti geografie, geologie, hydrologie, klimatologie, ochrany životního prostředí, dálkového průzkumu Země a dalších geověd), máte s jazykem R zkušenosti, ale potřebujete své znalosti adaptovat pro zpracování geodat, potřebujete zefektivnit analýzu geodat ve své organizaci. Jaké vstupní znalosti jsou potřeba? Pro účast na kurzu je vhodné mít znalosti v rozsahu kurzu Jazyk R za 1 den: základy pro analýzu vašich dat. Co se na kurzu naučíte? jak se orientovat v prostředí aplikace RStudio (zejm. pokud jde o specifické vlastnosti geodat v prostředí RStudia), jak importovat geodata různých formátů do R z různých zdrojů (souborů, serverových služeb a prostřednictvím specifických funkcí v R balíčcích), jak naopak efektivně ukládat geodata do souborů, aby nedocházelo ke ztrátě pracně vytvořených výsledků nebo meziproduktů, proč geograficky zatížená data zpracovávat pomocí na sebe navazujících algoritmických sekvencí (tzv. pipelines), jak využívat ekosystém balíčků tidyverse vzhledem ke zpracování vektorových geodat (především funkce balíčku sf), jak tvořit nová vektorová a rastrová geodata se specifikací souřadnicového referenčního systému – jak z existujících souřadnic, tak ze zcela nově definovaných souřadnicových párů (funkce balíčků sf, sfheaders) či rozsahu a horizontálního rozlišení (funkce balíčku terra), jak při zpracování geodat pomáhá funkcionální programování v R s definicemi anonymních funkcí, jak v R tvořit statické (tematické) mapy prostřednictvím funkcí balíčku ggplot2 a jemu podobných (např. tidyterra, ggspatial) nebo

Od dat k publikaci: výstupy, které projdou recenzí

Přihlásit na kurz Lektor: Mgr. Patrik Galeta, PhD. Zpracujte data ze svého výzkumu tak, aby váš článek bez problémů prošel recenzním řízením ve všech vědeckých časopisech. V kurzu pro vědecké pracovníky získáte praktický návod, jak vybrané statistické metody využít a popsat je v odborném článku. Po absolvování školení budete umět připravit podklady (rukopis, tabulky, grafy, dopis editorovi) pro recenzní řízení. Během kurzu pracujeme s praktickými ukázkami ze známých vědeckých periodik. 2denním kurzem vás provede Mgr. Patrik Galeta, PhD., odborný asistent katedry antropologie Západočeské univerzity v Plzni, který se statistice věnuje v rámci demografických studií (viz profil lektora). Procvičování probíhá na příkladech z přírodních a společenských věd v české verzi aplikace Statistica, popř. RStudio. Počítač vám zapůjčíme na místě, není třeba nosit vlastní. Chci se přihlásit Adresa konání kurzu Délka kurzu Z kurzu budete mít největší užitek, pokud: připravujete tabulky a grafy do rukopisu článku a potřebujete výchozí data správně zpracovat (vědečtí pracovníci), potřebujete porozumět standardům statistické analýzy ve vědeckých periodikách. Jaké vstupní znalosti jsou potřeba? Pro absolvování kurzu nejsou potřeba žádné specifické znalosti. Co se v kurzu naučíte? jak vyhodnotit vztah dvou a více proměnných pomocí t-testů, analýzy rozptylu, kontingenčních tabulek a regrese, co z výsledků analýzy do odborného článku vybrat, jak připravit tabulky s popisnými statistikami, jakým způsobem v odborné literatuře vhodně vizualizovat data, jaká je základní struktura odborného článku (kapitoly úvod, materiál, metody, výsledky, diskuse, závěr), podle jakých vzorových formulací se statistické výsledky píší, jak připravit rukopis do recenzního řízení (a popř. jej upravit na základě zpětné vazby). Chci vidět podrobný sylabus kurzu R a Rstudio Základy ovládání R pomocí knihoven tidyverse Popisná statistika Četnostní tabulky Popisné ukazatele (průměr, medián, rozptyl) Grafy v knihovně ggplot2   Opakování hodnocení vztahu proměnných t-testy, ANOVA Kontingenční tabulky Regrese a korelace   Základní struktura odborného článku s analýzou kvantitativních dat Kapitoly Úvod, Materiál, Metody, Výsledky, Diskuze, Závěr Co je obsahem jednotlivých kapitol Jak si vytvořit „vědecký prostor“   Prezentace základních analýz v odborném článku Struktura kapitol Materiál a Metody Strukturované psaní kapitoly Výsledky Očekávaný formát tabulek v rukopisu článku Očekávaný formát grafů, nutné minimum   Příklady dobré praxe Vzorové články s prezentací základních analýz Kritický rozbor textu Typy používaných formulací   Příprava podkladů pro rukopis článku Text rukopisu, soubory s grafy a tabulky, titulky grafů Dopis editorovi ukázka portálu pro odevzdání u mezinárodního odborného časopisu (např. https://mc.manuscriptcentral.com/) Návrh recenzentů   Základy zpracování odpovědi na recenzní řízení Úprava rukopisu Podrobná odpověď na připomínky recenzentů Názory spokojených účastníků Chci vidět

Pokročilá biostatistická analýza v jazyce R

Biostatistika I v R: získejte z dat výsledky, kterým budete rozumět + Biostatistika II v R: analýza přežití, pokročilé regresní modely – co vše umí data odhalit? Přihlásit na kurz Lektor: Mgr. Bc. Silvie Bělašková, PhD. Trvání kurzu: 4 dny Naučte se v jazyce R zpracovat a vyhodnotit klinická a biologická data základními i pokročilými metodami statistiky. Najděte ve svých měřeních skryté souvislosti a výrazně zvyšte kvalitu svých výzkumných publikací. Balíček za zvýhodněnou cenu kombinuje: A/ Biostatistika I v R: získejte z dat výsledky, kterým budete rozumět (2 dny) – design vědeckého experimentu, testování medicínských a biologických hypotéz pomocí parametrických (t-test, ANOVA, lineární regrese ad.) a neparametrických metod (Wilcoxnovy testy, Kruskal-Wallisova ANOVA), využívání kontingenčních tabulek. B/ Biostatistika II v R: analýza přežití, pokročilé regresní modely – co vše umí data odhalit? (2 dny) – vyhodnocení dat pomocí korelační analýzy, logistické regrese a dalších metod, základy vícerozměrných statistických metod a časových řad, metodiky servival a risk analysis. Procvičování příkladů probíhá v anglické verzi aplikace RStudio. Počítač vám zapůjčíme na místě, není třeba nosit vlastní. Chci se přihlásit Spokojených absolventů Adresa konání kurzu Délka kurzu Z kurzů budete mít největší užitek, pokud: se chcete naučit ovládat programovací jazyk R pro vyhodnocování dat ze svého klinického či biologického výzkumu základními i pokročilými metodami, potřebujete ve svých datech rychle najít důležité vazby a souvislosti, chcete výrazně zvýšit svou šanci na publikování v prestižním periodiku. Jaké vstupní znalosti jsou potřeba? Pro účast na kurzech je vhodné absolvovat nejprve kurz Jazyk R za 1 den: základy pro analýzu vašich dat. Co vše se naučíte? A/ Biostatistika I v R: získejte z dat výsledky, kterým budete rozumět jaké typy proměnných existují a jaké jsou mezi nimi rozdíly, co je průměr, medián, směrodatná odchylka a další popisné statistiky, kdy a jak je použít a jak je vizualizovat, jak otestovat normalitu dat a kdy použít parametrickou a neparametrickou statistiku, jak v programovacím jazyce R vyhodnocovat data a testovat hypotézy pomocí základních parametrických (t-test, ANOVA ad.) a neparametrických metod (Wilcoxnovy testy, Kruskal-Wallisova ANOVA), jak mezi sebou porovnat a otestovat dva a více datových souborů pomocí kontingenčních tabulek a chí-kvadrát testu, jak sestavit a použít jednoduchý regresní model, jak z pohledu biostatistiky správně nadesignovat vědecký experiment, jak správně zpracovat statistické pasáže ve vědeckých publikacích a na co si dát pozor. Biostatistika I v R: získejte z dat výsledky, kterým budete rozumět – podrobný sylabus Úvod do analýzy dat Typy proměnných. Popisná

Zvýhodněné balíčky kurzů

Zakupte si balíček 2 nebo více vybraných kurzů a ušetřete

[24. 4. 2024] Webinář ZDARMA: Jak získat 82% příspěvek na školení statistiky přes MPSV

Pod vedením zakladatele Datové akademie Dávida Tkáče mj. zjistíte: