0 votes
Typické chyby: příliš mnoho schvalovatelů, nejasná pravidla pro souběh dovolených a chybějící zástupce. Další častou chybou je, že se automatizace zavede, ale nikdo ji nepoužívá, protože je složitější než starý e-mail. Proto začněte jedním jednoduchým procesem pro jednu skupinu lidí. Až se osvědčí, rozšiřte ho.

Dalším častým omylem je zapomenout na lidskou kontrolu tam, kde jde o peníze nebo o osobní údaje. Automat může připravit podklad, ale odeslání platby nebo zveřejnění dokumentu by mělo zůstat na člověku, dokud se proces neprojeví jako spolehlivý. Stejně tak je nutné myslet na to, kdo ponese odpovědnost, když se něco pokazí. Bez jasně určené osoby se automatizace po pár měsících rozpadne.

Text musíte rozdělit na menší části, tzv. chunky. Tady vzniká nejvíc chyb. Příliš velké chunky obsahují mnoho témat a vyhledávač pak vrací nesouvislé odstavce. Příliš malé chunky zase ztrácejí kontext a model odpovídá vytrženě z reality. Osvědčuje se velikost kolem 300 až 500 tokenů s určitým překryvem, aby se informace na hranicích neztratila. Překryv nastavte na 10–20 procent délky chunku. Nezapomeňte, že chunk musí dávat smysl sám o sobě – pokud začíná uprostřed věty, je k ničemu.

Typická chyba je snaha zautomatizovat všechno najednou. Vznikne změť pravidel, které si nikdo nepamatuje, a při první výjimce se celý proces rozpadne. Lepší je zavést jednu automatizaci, nechat ji týden běžet, sledovat, kde selhává, a teprve pak přidat další. Další častá chyba je zapomenout na výjimky. Každý proces má případy, které se nevejdou do šablony, a pokud na ně automatizace nemyslí, lidé ji přestanou používat.

Začněte tím, že si jeden týden píšete, co vlastně děláte. Stačí obyčejný poznámkový blok nebo tabulka. Zapisujte úkol, čas, který mu věnujete, a jak často se opakuje. Po týdnu uvidíte, které činnosti se vracejí denně nebo několikrát týdně a zabírají nejvíc času. Automatizovat má smysl jen ty, které se opakují a mají jasná pravidla. Jednorázový úkol na automatizaci nepotřebuje.

Vyhledávání samotné má dvě části: nejprve najděte nejbližší vektory, pak je předejte modelu. Tady se často zapomíná na přeřazení výsledků. Vezměte třeba deset nejbližších chunků a použijte jednoduchý reranker, který je seřadí podle skutečné relevance k dotazu. Model pak dostane jen tři nebo čtyři nejlepší. Tím výrazně snížíte halucinace. Pokud reranker nemáte, alespoň omezujte počet předávaných chunků – příliš mnoho kontextu model spíš mate.

Většina lidí začne stavět RAG tak, že si vybere velký jazykový model a vektorovou databázi. To je ale až druhý krok. První a nejdůležitější je práce s daty. Pokud nakrmíte model nepořádkem, dostanete nepořádek i na výstupu. Vyberte konkrétní sadu dokumentů, kterou chcete prohledávat. Nemíchejte dohromady PDF, webové stránky a interní e-maily bez rozmyslu. Každý typ zdroje se chová jinak a šum z jednoho zničí přesnost ostatních.

Posledním krokem je sestavení promptu. Do systému vložte jasnou instrukci: odpovídej pouze na základě poskytnutých informací, pokud odpověď chybí, řekni to. Vložte všechny vybrané chunky a dotaz. Výsledek testujte na sadě otázek, u kterých znáte správnou odpověď. Sledujte, jestli model cituje správné části a jestli se neuchyluje k vymýšlení. Typická chyba je, že lidé věří prvnímu dojmu z pár dotazů. RAG je potřeba ladit iterativně – měnit chunking, embeddingy i počet výsledků. Bez měření a porovnávání se jen zaseknete na jednom nastavení, které funguje jen náhodou.

Nakonec nastavte, kdo za výstup odpovídá. AI je pomocník, ne schvalovatel. Pokud text podepisuje jednatel nebo jde k soudu, musí projít očima člověka, který rozumí věci. Jinak se stane to, co se děje pravidelně: firma zveřejní bezchybně gramaticky napsaný text, který je věcně špatně. A to je horší než překlep.

Důležité je také nastavit kontrolu. Automatizace nemá běžet naslepo. Určete, kdo jednou za čas zkontroluje výsledky, ať už jde o přenos dat nebo odeslané zprávy. Zároveň si udržujte přehled o tom, co které pravidlo dělá. Názvy jako „pravidlo 1" nebo „test" nikomu nepomohou. Pište si krátké poznámky, k čemu automatizace slouží a kdy vznikla.

Kde začít a čím nahradit ruční práci Nejjednodušší je začít u tabulek. Většina kanceláří používá tabulkový procesor a ten umí víc, než si lidé myslí. Místo ručního přepisování použijte vzorce, které propojí listy, funkce pro vyhledávání hodnot a kontingenční tabulky pro souhrny. Ušetříte nejen čas, ale hlavně odstraníte překlepy, které vznikají při opisování. Stejně tak lze nastavit podmíněné formátování, které samo zvýrazní položky po splatnosti nebo chybějící údaje.
ago by (120 points)

Your answer

Privacy: Your email address will only be used for sending these notifications.
...