Živá demonstrace: rozhodnutí není věta

Umělá inteligence na webu dnes většinou znamená chatbota: napíšete dotaz, dostanete odstavec. To je jedna podoba, kterou může model mít — ale není to podoba, kterou potřebuje software, když má sám něco rozhodnout: schválit, nebo zamítnout, eskalovat, nebo uzavřít. Novější skupina modelů, které se někdy označují jako „modely Systému 1" (podle rychlého, intuitivního uvažování v teorii duálního zpracování psychologa Daniela Kahnemana), větu úplně vynechává a místo ní odpovídá na přesně typovanou otázku.
Níže je malý, pevně daný příklad téhle myšlenky: podle krátké recenze zákazníka rozhodnout, zda je pozitivní, neutrální, nebo negativní — jiná odpověď není povolena. Napište vlastní text, nebo vyberte jednu ze tří připravených ukázek, stiskněte Vyhodnotit a uvidíte, co se skutečně stane — včetně toho, jak dlouho to trvalo a kolik to stálo, měřeno na našem serveru, ne odhadem.
Ukázka volá obecný jazykový model (OpenAI) s formátem odpovědi pevně omezeným na přesně tato tři slova. Vedle toho jde druhé, nezávislé volání na specializovaný typovaný rozhodovací model s názvem „Jev" od společnosti TypeSafe AI, dostupný přes tržiště třetí strany (OpenRouter) — na úplně stejnou pevně danou úlohu, měřenou úplně stejně: skutečný čas měřený na serveru, skutečná cena za volání z reálných čísel poskytovatele, medián ze tří volání u obou modelů. Pokud je tohle spojení někdy nedostupné, sloupec automaticky přejde na jasně označený odhad výrobce, místo aby selhalo celé srovnání.
Vše pod ukázkou vysvětluje, co čísla znamenají a co ne. Špatně postavené měření je totiž horší než žádné.
Obrázek 1. Tentýž úkol dvěma cestami — převzato z diagramu Katedry informačního inženýrství PEF ČZU.
Vyzkoušejte to sami
Vaše recenze
Tento text se odesílá ke zpracování mimo EU. Použijte prosím smyšlenou recenzi — nevkládejte nic osobního nebo skutečného.
Co z toho plyne
Typovaný rozhodovací model nepředpovídá další slovo — všechny otázky, které mu zadáte, vyhodnotí naráz v jediném průchodu a k odpovědi vrátí i pravděpodobnost. Zajímavé na tom není, že jde o „lepší AI". Jde o jiný tvar úlohy: jazykový model běžně vypisuje větu; typovaný rozhodovací model vybírá z předem daných možností a k výběru přidá číslo.
„Nemůže halucinovat" je tvrzení, u kterého se vyplatí být přesný. Platí jen pro formu odpovědi, ne pro její obsah: typovaný model si nevymyslí čtvrtou možnost, která nebyla ve schématu — ale klidně stejně sebejistě vybere špatnou ze tří, které dostal. První hodnocení modelu Jev — jak od výrobce, tak od nezávislých testerů — tenhle vzorec už potvrzují: na některých úzkých úlohách solidní výkon, na jiných znatelně slabší, a jak často se stane „sebejistá, ale špatná" odpověď, dost záleží na přesné formulaci otázky.
Obrázek 2. Co znamená „kalibrovaná" jistota a proč na ní záleží — převzato z diagramu Katedry informačního inženýrství PEF ČZU.
Přesně tady se hodí ta pravděpodobnost. Model, jehož jistota je dobře kalibrovaná — kde „na 90 %" opravdu vyjde zhruba v devíti z deseti případů — umožňuje nastavit práh: pod ním se nerozhoduje automaticky, případ jde k člověku. Takový práh je auditovatelný způsobem, jakým plynule znějící odstavec není, což je důvod, proč záleží i pro požadavek na lidský dohled, který Akt EU o umělé inteligenci klade na rizikovější automatizovaná rozhodnutí. Jestli jsou pravděpodobnosti modelu Jev takhle dobře kalibrované, je ale upřímně řečeno pořád otevřená otázka: firma nezveřejnila metodiku svého tréninkového přístupu a nezávislá hodnocení jsou zatím smíšená a dost závisí na konkrétní úloze.
Zkuste přes ukázku nahoře projet pár recenzí a sledujte, jak se mění pravděpodobnost, kterou vrací Jev — to číslo je skutečné, ne ilustrační. Jedna výhrada, kterou stojí za to říct otevřeně: ani TypeSafe, ani OpenRouter nepublikují potvrzenou evropskou trasu zpracování pro tento model, takže s ním z hlediska nakládání s daty počítejte stejně jako s voláním jazykového modelu — a použijte smyšlenou recenzi.