Jak AI generuje parametry a atributy produktů
Filtry na e-shopu jsou tak dobré, jak dobré jsou parametry. AI je umí vytěžit z textu, technických listů i fotek. Ukážeme postup, který drží čísla pod kontrolou.
Zákazník, který hledá lednici s šířkou do 60 cm a třídou energetické účinnosti D, nebude číst sto popisů. Klikne do filtrů. Když u poloviny produktů parametr chybí nebo je zapsaný pokaždé jinak, filtr je vyřadí, i když by vyhovovaly. Parametry přitom rozhodují i jinde: srovnávače podle nich párují nabídky, Google podle nich rozumí produktu a AI vyhledávače z nich skládají odpovědi.
Dodavatelé ale parametry posílají neúplně. Informace bývají schované v textu popisu, v PDF technickém listu nebo jen na fotce štítku. Přesně tady AI pomáhá nejvíc. V článku ukazujeme, jak vytěžování parametrů stavíme, aby výsledkem byla data, kterým jde věřit.
Odkud AI parametry bere
Parametry se dají vytěžit ze tří typů zdrojů. Každý má jiné silné stránky a jiná rizika:
| Zdroj | Co z něj dostanete | Na co si dát pozor |
|---|---|---|
| Text popisu a názvu | Materiál, barva, rozměry, kompatibilita | Marketingové nadsázky, údaje o jiném modelu v sérii |
| PDF technický list | Přesné technické hodnoty, tabulky | Více variant v jedné tabulce, zastaralé verze listu |
| Fotky produktu a štítku | Barva, tvar, počet kusů, údaje ze štítku | Barva zkreslená světlem, nečitelný text |
Současné modely zvládají všechny tři. Například Claude podle dokumentace Anthropicu čte PDF jako text i obraz, takže rozumí tabulkám a grafům. Stránka PDF typicky spotřebuje 1 500 až 3 000 tokenů podle hustoty obsahu. GPT modely i Gemini s obrázky a dokumenty pracují také.
Pravidlo, které se vyplácí: ke každému zdroji ukládejte, odkud a kdy přišel. Když se hodnota ukáže jako chybná, potřebujete vědět, jestli chybu udělal model, nebo byla už ve zdroji.
Krok 1: definujte schéma pro každou kategorii
Nejčastější chyba je chtít po modelu „vytáhni všechny parametry“. Dostanete pokaždé jiné názvy, jiné jednotky a jiný rozsah. Model potřebuje přesné zadání: pro tuto kategorii tyto parametry, v tomto formátu.
Schéma pro kategorii obsahuje u každého parametru:
- název tak, jak ho chcete mít ve filtru („Šířka“, ne „width“ nebo „Šíře spotřebiče“),
- typ: číslo, výčet hodnot, ano/ne, text,
- jednotku u čísel, jednu pro celou kategorii (například vždy cm),
- povolené hodnoty u výčtů (barvy, materiály, energetické třídy),
- povinnost: které parametry vyžaduje e-shop nebo srovnávač.
Schéma pak předáte modelu přes structured outputs. OpenAI, Anthropic i Google umí omezit výstup JSON schématem, takže model vrátí přesně daná pole a u výčtů jen povolené hodnoty. Tohle je obrovský rozdíl proti volnému textu, který by se musel dál parsovat.
Structured outputs ale zaručují formát, ne pravdivost. Model může do správně typovaného pole napsat špatné číslo. Proto další kroky.
Krok 2: ke každé hodnotě citace a možnost „neuvedeno“
Halucinace u parametrů vypadají nenápadně. Model „ví“, že lednice tohoto typu mívají šířku 60 cm, a tak ji doplní, i když ve zdroji není. Nebo vezme hodnotu z vedlejšího sloupce tabulky, který patří jiné variantě.
Proti tomu pomáhají dvě jednoduchá pravidla ve schématu:
- Každé pole může být prázdné. Model musí mít legitimní možnost říct „ve zdroji to není“. Když ji nemá, vymýšlí.
- Každá hodnota má citaci. Vedle hodnoty model vrátí krátký úryvek zdroje, ze kterého vychází. Kontrola pak může ověřit, že citovaný text ve zdroji opravdu je a obsahuje uvedené číslo.
Citace mají ještě jeden přínos. Když člověk kontroluje nejisté případy, nemusí hledat v dvacetistránkovém PDF. Vidí hodnotu a přesné místo, odkud pochází.
Krok 3: normalizace jednotek a hodnot
I se schématem přijdou hodnoty v různých podobách: „59,5 cm“, „595 mm“, „0,595 m“. Převody jednotek nenechávejte na jazykovém modelu. Model hodnotu vytáhne včetně původní jednotky a převod udělá obyčejný kód, který se nesplete.
Stejně tak u výčtových hodnot. Dodavatel píše „antracit“, „graphite“ a „tmavě šedá“. Pro filtr potřebujete jednu hodnotu. Postup:
- udržujte slovník synonym pro každý výčtový parametr,
- známé varianty převádějte slovníkem,
- neznámé nechte modelem navrhnout k zařazení a nový záznam do slovníku potvrďte člověkem.
Tahle normalizace je stejná práce jako mapování parametrů od dodavatelů, jen s AI jako pomocníkem na neznámé hodnoty.
Krok 4: kontrola pravidly a lidmi
Než parametry zapíšete do e-shopu, projdou automatickou kontrolou:
- Rozsahy. Šířka lednice 6 000 cm je chyba jednotky, ne zajímavý produkt.
- Konzistence. Objem mrazáku nemůže být větší než celkový objem.
- Shoda s variantou. Parametry musí patřit konkrétní variantě, ne celé řadě.
- Porovnání s daty dodavatele. Když dodavatel hodnotu poslal a AI vytěžila jinou, rozhoduje člověk.
Co projde, jde rovnou do katalogu. Co neprojde nebo má nízkou jistotu, čeká ve frontě na kontrolu. Úspěšnost vždy změřte na ručně ověřeném vzorku, než proces pustíte naplno.
Kam parametry zapsat
Parametry mají dvě cesty ven. První je váš e-shop a jeho filtry. Třeba Shoptet rozlišuje textové parametry a parametry pro filtrování a oba typy jde hromadně nahrát importem ze souboru XLSX, CSV nebo XML (podle nápovědy Shoptetu k 9/2026). Druhou cestou jsou feedy:
- Heureka přijímá parametry v elementu PARAM s dvojicí PARAM_NAME a VAL. Pro řadu kategorií má povinné parametry. Bez nich se nabídka při filtrování podle daného parametru nezobrazí. Číselné hodnoty mají obsahovat i jednotku.
- Google Merchant Center má pro technické údaje atribut product_detail se sekcí, názvem a hodnotou, vedle toho samostatné atributy jako barva, materiál nebo velikost.
Nejlépe funguje jedno místo pravdy, typicky PIM nebo katalog e-shopu, ze kterého se generuje web i každý XML feed. Názvy parametrů pro konkrétní srovnávač pak řeší mapování ve feedu, ne duplicitní data.
Modelový výpočet
Modelový příklad s předpoklady, ne výsledek projektu:
- 5 000 produktů, u každého PDF technický list o 3 stranách,
- vstup cca 7 000 tokenů na produkt (PDF kolem 2 000 tokenů na stranu plus schéma a instrukce),
- výstup cca 400 tokenů (hodnoty s citacemi),
- menší model za 1 USD za milion vstupních a 5 USD za milion výstupních tokenů (například Claude Haiku 4.5), dávkové zpracování se slevou 50 % (ceník k 9/2026, aktuální ceník ověřte u poskytovatele).
Vstup: 35 milionů tokenů, tedy 35 USD, po slevě 17,50 USD. Výstup: 2 miliony tokenů, 10 USD, po slevě 5 USD. Celkem kolem 23 USD za volání modelu. Stejně jako u kategorizace je dražší čas lidí na kontrolu než samotné AI. Každý dobře nastavený automatický test ušetří víc než levnější model.
Jak na to prakticky
- Vyberte kategorie, kde chybějící parametry nejvíc bolí: filtry, srovnávače, vracené zboží kvůli nejasným rozměrům.
- Pro každou kategorii sepište schéma parametrů s typy, jednotkami a povolenými hodnotami.
- Zajistěte zdroje: popisy, PDF listy, fotky štítků. Bez zdroje AI parametry nevytěží, jen odhadne.
- Nastavte extrakci se structured outputs, prázdnými hodnotami a citacemi.
- Převody jednotek a slovníky hodnot řešte kódem, ne modelem.
- Zapojte kontrolu pravidly a frontu pro člověka, změřte přesnost na vzorku.
- Zapisujte do jednoho místa pravdy a z něj generujte web i feedy.
Jednodušší AI řešení tohoto typu obvykle nasazujeme v řádu dnů až dvou týdnů. Pokud chcete doplnit parametry ve velkém, podívejte se na službu AI generování parametrů, případně na napojení dodavatelů a feedy, kde parametry řešíme už při importu. Rádi se podíváme na vzorek vašich dat a řekneme, co z nich jde vytěžit.
Potřebujete s tím pomoct?