generativní-ai
    strukturované-výstupy
    ai-gramotnost
    rozhodovací-modely

    Živá demonstrace: rozhodnutí není věta

    Živá demonstrace: rozhodnutí není věta

    Umělá inteligence na webu dnes většinou znamená chatbota: napíšete dotaz, dostanete odstavec. To je jedna podoba, kterou může model mít — ale není to podoba, kterou potřebuje software, když má sám něco rozhodnout: schválit, nebo zamítnout, eskalovat, nebo uzavřít. Novější skupina modelů, které se někdy označují jako „modely Systému 1" (podle rychlého, intuitivního uvažování v teorii duálního zpracování psychologa Daniela Kahnemana), větu úplně vynechává a místo ní odpovídá na přesně typovanou otázku.

    Níže je malý, pevně daný příklad téhle myšlenky: podle krátké recenze zákazníka rozhodnout, zda je pozitivní, neutrální, nebo negativní — jiná odpověď není povolena. Napište vlastní text, nebo vyberte jednu ze tří připravených ukázek, stiskněte Vyhodnotit a uvidíte, co se skutečně stane — včetně toho, jak dlouho to trvalo a kolik to stálo, měřeno na našem serveru, ne odhadem.

    Ukázka volá obecný jazykový model (OpenAI) s formátem odpovědi pevně omezeným na přesně tato tři slova. Vedle toho jde druhé, nezávislé volání na specializovaný typovaný rozhodovací model s názvem „Jev" od společnosti TypeSafe AI, dostupný přes tržiště třetí strany (OpenRouter) — na úplně stejnou pevně danou úlohu, měřenou úplně stejně: skutečný čas měřený na serveru, skutečná cena za volání z reálných čísel poskytovatele, medián ze tří volání u obou modelů. Pokud je tohle spojení někdy nedostupné, sloupec automaticky přejde na jasně označený odhad výrobce, místo aby selhalo celé srovnání.

    Vše pod ukázkou vysvětluje, co čísla znamenají a co ne. Špatně postavené měření je totiž horší než žádné.

    Diagram porovnávající sekvenční cestu jazykového modelu (věta, kterou je třeba rozebrat) s jedním průchodem typovaného rozhodovacího modelu a prahem jistoty

    Obrázek 1. Tentýž úkol dvěma cestami — převzato z diagramu Katedry informačního inženýrství PEF ČZU.

    Vyzkoušejte to sami

    Živě

    Vaše recenze

    66 / 1000 znaků

    Tento text se odesílá ke zpracování mimo EU. Použijte prosím smyšlenou recenzi — nevkládejte nic osobního nebo skutečného.

    Co z toho plyne

    Typovaný rozhodovací model nepředpovídá další slovo — všechny otázky, které mu zadáte, vyhodnotí naráz v jediném průchodu a k odpovědi vrátí i pravděpodobnost. Zajímavé na tom není, že jde o „lepší AI". Jde o jiný tvar úlohy: jazykový model běžně vypisuje větu; typovaný rozhodovací model vybírá z předem daných možností a k výběru přidá číslo.

    „Nemůže halucinovat" je tvrzení, u kterého se vyplatí být přesný. Platí jen pro formu odpovědi, ne pro její obsah: typovaný model si nevymyslí čtvrtou možnost, která nebyla ve schématu — ale klidně stejně sebejistě vybere špatnou ze tří, které dostal. První hodnocení modelu Jev — jak od výrobce, tak od nezávislých testerů — tenhle vzorec už potvrzují: na některých úzkých úlohách solidní výkon, na jiných znatelně slabší, a jak často se stane „sebejistá, ale špatná" odpověď, dost záleží na přesné formulaci otázky.

    Diagram vysvětlující kalibrovanou jistotu: model je kalibrovaný, když deklarovaná jistota 90 % odpovídá skutečné úspěšnosti 90 %; křivka přeceňujícího modelu leží pod úhlopříčkou

    Obrázek 2. Co znamená „kalibrovaná" jistota a proč na ní záleží — převzato z diagramu Katedry informačního inženýrství PEF ČZU.

    Přesně tady se hodí ta pravděpodobnost. Model, jehož jistota je dobře kalibrovaná — kde „na 90 %" opravdu vyjde zhruba v devíti z deseti případů — umožňuje nastavit práh: pod ním se nerozhoduje automaticky, případ jde k člověku. Takový práh je auditovatelný způsobem, jakým plynule znějící odstavec není, což je důvod, proč záleží i pro požadavek na lidský dohled, který Akt EU o umělé inteligenci klade na rizikovější automatizovaná rozhodnutí. Jestli jsou pravděpodobnosti modelu Jev takhle dobře kalibrované, je ale upřímně řečeno pořád otevřená otázka: firma nezveřejnila metodiku svého tréninkového přístupu a nezávislá hodnocení jsou zatím smíšená a dost závisí na konkrétní úloze.

    Zkuste přes ukázku nahoře projet pár recenzí a sledujte, jak se mění pravděpodobnost, kterou vrací Jev — to číslo je skutečné, ne ilustrační. Jedna výhrada, kterou stojí za to říct otevřeně: ani TypeSafe, ani OpenRouter nepublikují potvrzenou evropskou trasu zpracování pro tento model, takže s ním z hlediska nakládání s daty počítejte stejně jako s voláním jazykového modelu — a použijte smyšlenou recenzi.

    Nastavení cookies

    Používáme nezbytné cookies pro bezpečný a správný chod portálu. Volitelné analytické cookies nám pomáhají zlepšovat služby. Své nastavení můžete kdykoliv změnit.