Feature selection, česky výběr rysů, výběr příznaků nebo výběr proměnných, je postup ve strojovém učení, při kterém se z původní datové sady vybere jen část vstupních proměnných, které jsou pro daný model a úlohu skutečně užitečné. Cílem není vytvářet nové proměnné, ale ponechat z původních sloupců ty nejdůležitější a zbytek odstranit.
Feature selection patří mezi základní metody redukce dimenzionality. Pokud má datová sada desítky, stovky nebo tisíce sloupců, model nemusí potřebovat všechny. Některé proměnné nesou důležitý signál, jiné jsou slabé, duplicitní, náhodné nebo pro danou úlohu úplně zbytečné.
Ve strojovém učení se často pracuje s daty, která vypadají na první pohled bohatě. Máte hodně sloupců, hodně měření, hodně parametrů. Jenže více proměnných automaticky neznamená lepší model. Někdy je to přesně naopak – model se v datech začne ztrácet, učí se náhodné vztahy a hůře funguje na nových datech.
Feature selection znamená, že z původních proměnných vybereme jen ty, které modelu opravdu pomáhají. Původní význam sloupců zůstává zachovaný – pouze se rozhodne, které sloupce se použijí a které ne.
Co znamená feature
Slovo feature se v češtině překládá různě.
Nejčastěji jako rys, příznak, atribut, proměnná nebo vstupní vlastnost. Ve všech případech jde o jednu informaci, se kterou model pracuje.
Pokud model odhaduje cenu domu, může být jedním rysem plocha domu, dalším lokalita, dalším počet pokojů, dalším stáří domu a dalším energetická náročnost. Pokud model předpovídá, zda zákazník nakoupí, mohou být rysy počet předchozích objednávek, hodnota posledního nákupu, zdroj návštěvy, reakce na newsletter nebo doba od poslední návštěvy webu.
Feature tedy není nic složitého. V tabulkových datech si ji můžete představit jako jeden sloupec. U složitějších dat, například textu nebo obrázků, může jít o číselnou vlastnost, kterou si model z dat odvodil nebo kterou mu připravíme při předzpracování.
Proč výběr rysů vůbec řešit
Na první pohled může působit logicky, že čím více proměnných model dostane, tím více informací má k dispozici. Jenže model se neučí jen z užitečných dat. Učí se ze všeho, co mu dáme. Pokud mu dáme i šum, duplicity a náhodné souvislosti, bude se učit i z nich.
Výběr rysů pomáhá modelu pracovat s menším, čistším a smysluplnějším souborem vstupů. Díky tomu může být model rychlejší, přehlednější a v některých případech také přesnější. Zároveň se sníží riziko, že se model naučí vztahy, které platí jen v trénovacích datech, ale v reálném provozu už ne.
Feature selection se používá hlavně proto, aby se:
- zjednodušil model – model nemusí zpracovávat proměnné, které mu nepomáhají,
- snížila výpočetní náročnost – méně vstupů často znamená rychlejší trénování i predikci,
- omezil šum v datech – odstraní se proměnné, které výsledek spíše matou,
- snížilo riziko přeučení – model má méně prostoru učit se náhodné vzory,
- zlepšila vysvětlitelnost – člověk lépe chápe, z čeho model vychází,
- omezil zbytečný sběr dat – není nutné dlouhodobě sbírat údaje, které modelu nic nepřinášejí.
U výběru rysů nejde o to odstranit co nejvíce sloupců. Cílem je ponechat takové proměnné, které mají pro danou úlohu největší hodnotu.
Příklad s odhadem ceny domu
Představte si, že máte tabulku s údaji o domech. Každý dům je popsán stovkou vlastností. Najdete tam plochu, lokalitu, počet pokojů, stav nemovitosti, velikost pozemku, stáří střechy, typ vytápění, energetickou třídu, vzdálenost od školy, dopravní dostupnost, materiál oken, barvu fasády, typ klik u dveří nebo počet venkovních světel.
Pokud chcete odhadovat cenu domu, některé údaje budou pravděpodobně velmi důležité. Typicky lokalita, obytná plocha, technický stav, velikost pozemku, energetická náročnost a dostupnost služeb. Jiné údaje mohou být slabší. Barva fasády nebo typ klik mohou mít v některých případech vliv na dojem kupujícího, ale pro základní odhad ceny většinou nebudou stejně důležité jako lokalita nebo plocha.
Feature selection v takovém případě pomáhá vybrat proměnné, které se mají v modelu ponechat. Model pak nemusí pracovat se stovkou údajů, ale třeba jen s dvaceti, které mají pro odhad ceny největší význam.
Relevantní, irelevantní a redundantní proměnné
Ne všechny proměnné v datech mají stejnou hodnotu. Některé jsou pro model důležité, jiné jsou zbytečné a další pouze opakují informaci, kterou už model dostává jiným sloupcem.
- Relevantní proměnná je taková, která modelu pomáhá rozhodovat. U odhadu ceny domu to může být lokalita, plocha nebo technický stav. U predikce nákupu to může být počet předchozích objednávek nebo čas od poslední návštěvy webu.
- Irelevantní proměnná je taková, která s výsledkem prakticky nesouvisí. Pokud chcete odhadovat cenu domu, náhodně vytvořené interní ID řádku pravděpodobně žádnou užitečnou informaci nepřinese.
- Redundantní proměnná je taková, která sice nějakou informaci nese, ale stejná nebo velmi podobná informace už je v datech jinde. Například obytná plocha v metrech čtverečních a stejná plocha přepočtená do jiné jednotky mohou modelu říkat téměř totéž.
Redundantní proměnná nemusí být úplně špatná. Problém je v tom, že modelu často nepřidává novou informaci, ale zvyšuje složitost dat a může komplikovat interpretaci.
Feature selection vs. feature extraction
Feature selection se často plete s pojmem feature extraction. Oba postupy souvisejí s redukcí dimenzionality, ale fungují jinak.
Feature selection vybírá část původních proměnných. Pokud má tabulka 100 sloupců, metoda může vybrat 20 z nich a zbytek vynechat. Původní význam sloupců se nemění. Stále víte, že model používá například lokalitu, plochu, stáří domu nebo energetickou třídu.
Feature extraction vytváří nové proměnné z původních dat. Nevybírá jen existující sloupce, ale převádí data do nové podoby. Typickým příkladem je PCA, tedy analýza hlavních komponent, která z původních proměnných vytvoří nové komponenty.
Výběr rysů je proto obvykle lépe vysvětlitelný. Když ponecháte původní sloupce, snáze vysvětlíte, proč model používá právě tyto informace. U extrakce rysů může být výsledek matematicky užitečný, ale pro člověka hůře čitelný.
Hlavní typy metod feature selection
Metody výběru rysů se obvykle dělí do tří hlavních skupin: filtrační metody, wrapper metody a embedded metody. Liší se hlavně tím, jestli proměnné hodnotí samostatně, pomocí konkrétního modelu, nebo přímo během jeho trénování.
- Filtrační metody – filtrační metody hodnotí proměnné podle statistického kritéria ještě před samotným trénováním modelu. Sledují například korelaci, vzájemnou informaci, chí-kvadrát test nebo rozdíly mezi skupinami. Jejich výhodou je rychlost a jednoduchost. Hodí se hlavně jako první krok, když máte hodně proměnných a potřebujete odstranit ty, které jsou zjevně slabé, prázdné nebo nepoužitelné. Nevýhodou je, že často posuzují proměnné odděleně. Proměnná, která sama o sobě vypadá slabě, může být v kombinaci s jinou proměnnou užitečná. Filtrační metoda to nemusí zachytit.
- Wrapper metody – wrapper metody hodnotí různé kombinace proměnných podle toho, jak s nimi funguje konkrétní model. Nejde tedy jen o čistě statistické posouzení, ale o testování výkonu modelu s různými sadami vstupů. Typicky se proměnné postupně přidávají nebo odebírají. Model se opakovaně trénuje a sleduje se, která kombinace rysů dává nejlepší výsledek. Výhodou je, že wrapper metody berou v úvahu konkrétní model a konkrétní úlohu. Nevýhodou je vyšší výpočetní náročnost. Pokud máte tisíce proměnných, testování mnoha kombinací může být velmi pomalé.
- Embedded metody – embedded metody provádějí výběr proměnných přímo během trénování modelu. Výběr rysů tedy není samostatný krok před modelováním, ale součást samotného učení. Příkladem mohou být modely s regularizací, například Lasso, které dokážou některým proměnným přiřadit nulovou nebo velmi nízkou váhu. Dalším příkladem jsou stromové modely, které umí odhadovat důležitost proměnných podle toho, jak moc pomáhají při rozhodování.
Filtrační metody jsou rychlé, wrapper metody testují proměnné přes konkrétní model a embedded metody vybírají rysy přímo během trénování. V praxi se často kombinuje technická metoda s odborným úsudkem.
Jak výběr rysů probíhá v praxi
Feature selection není jednorázové kliknutí na tlačítko. Dobře provedený výběr rysů kombinuje pochopení úlohy, kontrolu dat, technickou analýzu a ověření výsledku na datech, která model při učení neviděl.
Nejdříve je potřeba vědět, co má model řešit. Jiný výběr proměnných bude dávat smysl pro odhad ceny domu, jiný pro detekci podvodů, jiný pro predikci nákupu a jiný pro klasifikaci textů.
Potom se kontroluje kvalita dat. Odstraňují se prázdné sloupce, technické identifikátory bez významu, duplicity, extrémní hodnoty nebo proměnné, které by v reálném provozu nebyly dostupné. Teprve potom dává smysl řešit statistický nebo modelový výběr rysů.
V praxi se často postupuje takto:
- určí se cíl modelu – co má model předpovídat nebo klasifikovat,
- zkontrolují se data – chybějící hodnoty, duplicity, extrémy a nesmyslné sloupce,
- vyřadí se zjevně nepoužitelné proměnné – například prázdné sloupce nebo technická ID bez významu,
- použije se metoda výběru rysů – například korelace, důležitost proměnných nebo rekurzivní eliminace,
- model se otestuje – sleduje se, zda výběr rysů skutečně pomohl,
- výsledek se ověří věcně – technický výběr musí dávat smysl i odborně.
Únik informace při feature selection
Jedním z největších rizik je únik informace, anglicky data leakage. Nastává ve chvíli, kdy se model při trénování dostane k informaci, kterou by v reálném provozu neměl znát.
Příklad: chcete předpovědět, zda zákazník odejde ke konkurenci. V datech ale necháte sloupec „datum ukončení smlouvy“. Model potom nebude skutečně předpovídat odchod zákazníka, protože už dostává informaci, která výsledek prozrazuje.
Podobný problém vzniká, když se výběr rysů provede na celé datové sadě a teprve potom se data rozdělí na trénovací a testovací část. Testovací data tak nepřímo ovlivnila výběr proměnných a výsledek modelu může vypadat lepší, než ve skutečnosti je.
Výběr rysů, škálování i další úpravy dat se mají učit pouze z trénovacích dat. Testovací data mají zůstat stranou až pro závěrečné ověření.
Výběr rysů a přeučení modelu
Přeučení, anglicky overfitting, vzniká tehdy, když se model příliš přizpůsobí trénovacím datům. Naučí se nejen obecné vztahy, ale i náhodné detaily, které v nových datech neplatí.
Velké množství proměnných může přeučení podporovat. Model má více možností najít náhodné kombinace, které v trénovacích datech vypadají jako užitečné. Ve skutečnosti ale nemusí jít o stabilní vztah.
Feature selection může riziko přeučení snížit tím, že odstraní část slabých, duplicitních nebo šumových vstupů. Model potom pracuje s menším počtem proměnných a má menší prostor učit se náhodné souvislosti.
Výběr rysů a vysvětlitelnost modelu
Jedna z hlavních výhod feature selection je lepší vysvětlitelnost. Pokud model používá 12 dobře pochopitelných proměnných místo 800 sloupců, je mnohem snazší vysvětlit, proč rozhoduje určitým způsobem.
To je důležité hlavně v oblastech, kde model ovlivňuje reálné rozhodování. Může jít o úvěry, pojištění, zdravotnictví, obchodní predikce nebo řízení rizik. V takových případech nestačí vědět, že model má dobré skóre. Je potřeba rozumět tomu, z jakých vstupů vychází.
Výběr rysů také pomáhá odhalit, zda model nepoužívá proměnné, které jsou nevhodné, nestabilní, právně problematické nebo jen zástupně odrážejí citlivé informace.
Kdy feature selection pomáhá nejvíce
Výběr rysů má největší smysl tam, kde je počet proměnných vysoký, část z nich je duplicitní nebo šumová a zároveň potřebujete model udržet srozumitelný.
Typicky jde o tabulková data, marketingovou analytiku, medicínská data, textovou analýzu, finanční modely, zákaznické segmentace nebo systémy pro detekci anomálií.
Feature selection bývá užitečná hlavně tehdy, když:
- máte mnoho sloupců – například stovky až tisíce vstupních proměnných,
- máte málo řádků vzhledem k počtu proměnných – model je pak náchylnější k přeučení,
- proměnné se navzájem opakují – více sloupců říká podobnou informaci,
- data obsahují šum – část vstupů je nepřesná, slabá nebo náhodná,
- potřebujete model vysvětlit – menší počet proměnných je pro člověka čitelnější,
- chcete snížit náklady na data – není nutné sbírat údaje, které modelu nepomáhají.
Už jste četli? E-A-T – postatný faktor hodnocení?
Kdy se výběr rysů nemusí vyplatit
Feature selection není potřeba používat vždy. Pokud máte malý počet dobře vybraných, kvalitních a odborně odůvodněných proměnných, není nutné je za každou cenu dál redukovat.
Opatrnost je namístě také tehdy, když proměnná sama o sobě vypadá slabě, ale v kombinaci s jinými proměnnými nese důležitou informaci. Příliš agresivní výběr rysů ji může odstranit a model se tím zhorší.
Výběr rysů proto nesmí být mechanické mazání sloupců podle jednoho čísla. Má jít o ověřený postup, který se kontroluje na výsledku modelu a zároveň dává smysl v kontextu oboru.
U feature selection není cílem mít nejmenší možný počet proměnných. Cílem je mít takový počet proměnných, který modelu stačí k dobrému rozhodování a člověku umožní výsledek rozumně kontrolovat.
Feature selection v marketingu a e-commerce
V marketingu a e-commerce se výběr rysů používá například při predikci nákupu, segmentaci zákazníků, odhadu hodnoty zákazníka, detekci odchodu zákazníka nebo personalizaci nabídky.
Model může mít k dispozici mnoho údajů: počet návštěv webu, typ zařízení, zdroj návštěvy, počet objednávek, průměrnou hodnotu košíku, reakce na newsletter, prohlížené kategorie, čas od posledního nákupu nebo využité slevy.
Ne všechny údaje ale budou stejně důležité. Pro predikci opakovaného nákupu může být podstatnější čas od poslední objednávky, počet předchozích nákupů a oblíbené kategorie než drobné technické údaje o první návštěvě webu.
Feature selection u textových dat
U textových dat může být počet proměnných obrovský. Pokud model pracuje se slovy, tokeny nebo n-gramy, může slovník obsahovat desetitisíce položek. Ne každé slovo ale pomáhá rozlišit téma, význam nebo kategorii textu.
Výběr rysů může pomoci odstranit příliš častá, příliš vzácná nebo málo informační slova. U klasifikace textů může například ukázat, která slova nebo výrazy skutečně pomáhají rozpoznat, do jaké kategorie dokument patří.
U moderních embeddingů je situace jiná, protože text už není reprezentován jen jako seznam slov, ale jako číselný vektor. Přesto zůstává základní princip podobný – cílem je pracovat s takovou reprezentací, která obsahuje co nejvíce podstatné informace a co nejméně šumu.
Jak poznat, že feature selection pomohla
Nejdůležitější otázka nezní, kolik proměnných jsme odstranili. Důležitější je, zda model po výběru rysů funguje lépe, rychleji, stabilněji nebo srozumitelněji.
Výsledek je potřeba hodnotit na validačních nebo testovacích datech. Nestačí sledovat výkon na trénovacích datech, protože tam může model vypadat dobře i tehdy, když se přeučil.
Při vyhodnocení se sleduje hlavně:
- výkon modelu – zlepšila se vhodná metrika pro danou úlohu,
- stabilita výsledků – drží se výkon i na nových datech,
- rychlost – zrychlilo se trénování nebo predikce,
- vysvětlitelnost – je jasnější, z čeho model vychází,
- datová náročnost – lze omezit zbytečný sběr a čištění dat,
- odborný smysl – odpovídá výběr proměnných realitě daného oboru.
Typické chyby při feature selection
Výběr rysů může výrazně pomoci, ale také může model poškodit. Nejčastější chybou je spoléhat jen na automatickou metodu a neověřit, zda výsledek dává smysl technicky i věcně.
Mezi typické chyby patří:
- výběr podle celé datové sady – může způsobit únik informace do testovacích dat,
- slepé odstranění slabých proměnných – některé proměnné mohou být důležité jen v kombinaci s jinými,
- ignorování odborného kontextu – technická metoda nemusí chápat obchodní, medicínský nebo právní význam proměnných,
- záměna korelace za příčinu – proměnná může s výsledkem souviset, ale nemusí jej skutečně vysvětlovat,
- ponechání únikových proměnných – některé sloupce mohou prozrazovat cílový výsledek,
- příliš agresivní redukce – model může přijít o užitečné signály,
- hodnocení jen podle jednoho modelu – sada proměnných vhodná pro jeden model nemusí být nejlepší pro jiný.
Špatný výběr rysů může vytvořit jednodušší, ale horší model. Každé odstranění proměnných je potřeba ověřit na datech, která model při učení neviděl.
Jak si feature selection zapamatovat
Feature selection si můžete představit jako výběr nejdůležitějších indicií. Vyšetřovatel může mít stovky informací, ale ne všechny jsou stejně důležité. Některé vedou přímo k závěru, jiné jsou jen doprovodné a další mohou být zavádějící.
Podobně model nepotřebuje každou proměnnou jen proto, že ji umíme změřit. Potřebuje hlavně takové proměnné, které mu pomáhají lépe rozhodovat v konkrétní úloze.
Feature selection znamená, že z původních vstupních proměnných vybereme menší počet těch, které mají pro model největší význam. Data se tím zjednoduší, ale původní význam ponechaných sloupců zůstává zachovaný.
Související pojmy
- Redukce dimenzionality – širší pojem pro snižování počtu dimenzí v datech. Feature selection je jednou z jejích hlavních forem, protože snižuje počet proměnných výběrem části původních rysů.
- Strojové učení – oblast, ve které se modely učí z dat. Výběr rysů patří k důležitým krokům přípravy dat před trénováním modelu.
- Embedding – číselná reprezentace obsahu, například textu, obrázku nebo dokumentu. Embeddingy často obsahují mnoho dimenzí, proto s nimi souvisí téma výběru, komprese a zjednodušování reprezentace.
- Velký jazykový model (LLM) – model určený pro práci s jazykem. S výběrem rysů souvisí nepřímo, protože jazykové modely pracují s číselnými reprezentacemi textu a velkým množstvím vnitřních signálů.
- Neuronová síť – model inspirovaný propojením neuronů, který se učí z dat. U neuronových sítí se sice často pracuje s automatickým učením reprezentací, ale kvalita vstupních proměnných zůstává důležitá.
- Generativní AI – typ umělé inteligence, který vytváří nový obsah. U generativních systémů je kvalita vstupních dat a reprezentací zásadní, protože ovlivňuje kvalitu výsledného výstupu.
Použité zdroje a další čtení
- Výběr rysů – cs.wikipedia.org – červen 2026 – český přehled pojmu výběr rysů, včetně alternativních názvů jako selekce rysů, výběr proměnných nebo výběr atributů.
- Snížení dimenzionality – cs.wikipedia.org – červen 2026 – české vysvětlení širšího tématu redukce rozměrů a práce s vysokodimenzionálními daty.
- Strojové učení: pojmy – umimeinformatiku.cz – červen 2026 – jednoduchý český přehled pojmů ze strojového učení, vhodný pro čtenáře, kteří se v terminologii teprve orientují.
- Feature selection – scikit-learn.org – červen 2026 – dokumentace knihovny scikit-learn popisuje metody výběru rysů a jejich použití při práci s vysokodimenzionálními daty.
- What is Feature Selection? – ibm.com – červen 2026 – srozumitelné vysvětlení feature selection z pohledu výkonu modelu, výpočetních nároků a kvality vstupních dat.
