← Späť na blog AI agenti, pamäť a AGI

Sme už pri AGI? Model je len časť príbehu

Schopný model, pamäť, nástroje a overovanie výsledkov. Cesta k všeobecne použiteľnej umelej inteligencii môže viesť aj cez spôsob, akým tieto časti spojíme. ITHZ-MCP36.6 ukazuje jeden konkrétny krok.

Sklenená neurónová sieť prepojená s pamäťou, nástrojmi a overovaním
Ilustračný obrázok vytvorený pomocou AI.

Schopný model, pamäť, nástroje a overovanie výsledkov. Cesta k všeobecne použiteľnej umelej inteligencii môže viesť aj cez spôsob, akým tieto časti spojíme. ITHZ-MCP36.6 ukazuje jeden konkrétny krok.

Predstavte si kolegu, ktorý dokáže za pár minút pochopiť cudzí program, vysvetliť jeho chybu a navrhnúť opravu. Na druhý deň však potrebuje znovu dostať celé zadanie. Neskôr nájde starú poznámku a nevšimne si, že už neplatí. A keď mu niekto do dokumentácie pripíše presvedčivé tvrdenie, začne podľa neho konať.

Pri takom kolegovi by nás zaujímalo viac než výsledok inteligenčného testu. Chceli by sme vedieť, či dokáže nadviazať na včerajšiu prácu, použiť opravu aj nabudúce a rozpoznať, kedy má nedostatočné podklady. Presne na tieto otázky narážame aj pri skladaní AI agentov.

AGI znamená artificial general intelligence, teda všeobecnú umelú inteligenciu. V diskusii sa pod touto skratkou stretávajú rôzne očakávania: široká použiteľnosť, výkon porovnateľný s človekom, schopnosť učiť sa nové úlohy či samostatne dokončovať prácu. Preto môže tá istá technológia jednému človeku pripadať ako začiatok AGI a druhému ako jej stále nedostatočný predchodca.

Názor, že prvé AGI už existujú, má aj odborných zástancov. Blaise Agüera y Arcas a Peter Norvig v roku 2023 argumentovali, že vtedajšie pokročilé jazykové modely už prekročili podstatnú hranicu všeobecnosti: zvládali rozličné úlohy a dokázali využiť nové príklady v zadaní. Ich stanovisko kladie veľkú váhu na šírku schopností a pripúšťa aj výraznú nedokonalosť. Je to konkrétna interpretácia AGI, nie jednotný verdikt odbornej komunity. Ich argument je dostupný v pôvodnej eseji.

Užitočný medzistupeň ponúka rámec Levels of AGI, publikovaný výskumníkmi Google DeepMind na ICML 2024. Rozlišuje šírku schopností a úroveň výkonu; samostatne rozoberá autonómiu. Vtedajšie systémy ako ChatGPT, Bard či Llama 2 orientačne zaradil do kategórie Emerging AGI, teda vznikajúcej AGI. Vyššia úroveň Competent AGI vyžaduje aspoň výkon na úrovni 50. percentilu dospelých s príslušnými zručnosťami naprieč väčšinou kognitívnych úloh. Autori zároveň upozorňujú, že jednoznačné zaradenie potrebuje vhodné široké meranie. Ide o rámec z roku 2024, nie o nové hodnotenie dnešných modelov či ITHZ. Levels of AGI

Odpoveď na otázku „už sme tam?“ teda závisí aj od zvolenej definície. Podľa širokého chápania všeobecnosti možno hovoriť o raných formách AGI. Pri požiadavke spoľahlivého výkonu a učenia naprieč veľmi rozmanitými situáciami treba predložiť oveľa viac dôkazov. Samotné pomenovanie nám ďalšiu schopnosť nepridá. Môže nám však pomôcť presnejšie určiť, ktorú časť ešte potrebujeme vybudovať.

Pre ITHZ je zaujímavá práve otázka celého systému. Programátor pracuje s dokumentáciou, históriou zmien, testami a skúsenosťami tímu. Keď hodnotíme jeho prácu, tieto pomôcky sú prirodzenou súčasťou prostredia. Podobne má zmysel merať AI agenta spolu s nástrojmi a pamäťou, ktoré skutočne používa. Pri porovnávaní pritom musíme priznať ich prínos, cenu aj množstvo ľudskej pomoci.

Moja pracovná hypotéza je, že časť cesty k všeobecnejšiemu a spoľahlivejšiemu agentovi vedie práve cez túto architektúru. Silný model dodá schopnosť spracovať zadanie a navrhnúť postup. Pamäť zachová skúsenosť. Nástroje umožnia zasiahnuť do prostredia a zmerať výsledok. Overovanie pomôže rozhodnúť, čo z výsledku naozaj vyplýva. Ich spojenie treba hodnotiť podľa toho, či agent následne dokončí viac nových úloh s menším počtom chýb.

Zlepšovanie cez spätnú väzbu a pamäť má aj výskumný precedens. Práca Reflexion skúmala agentov, ktorí si uchovávali textové poučenia z výsledkov predchádzajúcich pokusov a využívali ich pri ďalšom rozhodovaní bez zmeny váh modelu. Ukazuje, prečo má zmysel skúmať adaptáciu aj na úrovni celého systému. Výsledky tejto práce však nemožno automaticky preniesť na inú implementáciu. Reflexion

Pri pamäti sa rýchlo objaví ďalšia otázka: čo sa vlastne smie stať poučením? Záznam „tento postup raz fungoval“ môže byť užitočný. Veta „tento postup je vždy bezpečný“ už tvrdí podstatne viac. Ak si agent uchová práve takúto skratku, pamäť mu môže pomáhať opakovať chybu s rastúcou istotou.

ITHZ-MCP36.6, verzia 0.1.0a16, preto rozvíja pamäť naviazanú na konkrétne podklady. Ide o označenie vydania projektu ITHZ-MCP, nie o verziu samotného štandardu MCP. Aktuálne verejné vydanie zostáva vo fáze alfa. Verejný repozitár a opis vydania

Jeho posledné opravy sa dajú vysvetliť tromi bežnými situáciami. Keď overíme dokument, čitateľ musí dostať práve jeho overený obsah. Keď požiadame oponenta o posudok, musí dostať podklad na čítanie. A keď vytvoríme súhrn, potrebujeme zachovať odkazy, ktoré umožňujú skontrolovať jeho tvrdenia.

MCP36.6 preto viaže zobrazovaný aktívny poznatok na podpísaný záznam, oddeľuje overenie neporušenosti súboru od doručenia jeho obsahu hodnotiteľovi a zachováva väzby na zdroje cez ďalšie spracovanie. Podpis identifikuje potvrdenie od nastavenej dôveryhodnej autority; pravdivosť ľubovoľného tvrdenia sám nezaručuje. Prínos týchto kontrol spočíva v tom, že sa podklady a závery cestou menej ľahko zamenia. Dokumentácia MCP36.6

Aj hodnotenie návrhov má svoje pravidlá. CCG, sprievodná vrstva kontroly a oprávnení v ITHZ, umožňuje pracovať s viacerými hodnotiacimi rolami. Voliteľný postup dá oponentovi najprv pôvodné podklady, až následne návrh kolegu. Je to spôsob, ako obmedziť predčasné ovplyvnenie spoločným záverom. Viac hlasov samo osebe neposkytuje záruku správnosti a úspešná kontrola automaticky nepovoľuje ďalší vonkajší zásah. Opis zachovaných kontrol

Náš interný živý syntetický experiment z 8. septembra 2026 ukázal, prečo sa oplatí takúto pamäť skúmať. Použil model gpt-5.6-luna s nastavením medium. Po samostatnom pilote nasledoval hlavný beh: 12 extrakcií poučenia a 288 rozhodnutí. Rovnaký model dostával úlohy bez pamäte, s obyčajnými poznámkami, s pamäťou spracovanou cez kontroly ITHZ a s poznámkami z iného prostredia.

Podmienka v hlavnom behu Správne rozhodnutia Nesprávne konkrétne akcie
Bez pamäte 24 zo 72 0
Obyčajné poznámky 60 zo 72 11
ITHZ pamäť 72 zo 72 0
Pomiešaná pamäť 24 zo 72 0

Celý náskok pred obyčajnými poznámkami vznikol pri vloženej falošnej spomienke. Bez filtrovania model jedenásťkrát vybral nesprávnu akciu a raz požiadal o dôkaz. Kontroly ITHZ neoverený záznam vyradili ešte pred odovzdaním pamäte modelu; v tejto podmienke bolo všetkých dvanásť rozhodnutí správnych. V ostatných piatich situáciách dosiahli obyčajné poznámky a ITHZ rovnaké skóre. Model bez použiteľnej pamäte väčšinou požiadal o dôkaz, čo je rozumné správanie pri chýbajúcej informácii.

Tieto čísla merajú úzko vymedzenú vlastnosť systému. Model dostal pripravenú korekciu a úlohy zdieľali jednoduchú šablónu pravidla. Pokus používal syntetické podpisové autority a skutočné kontroly aktívnej pamäte z ITHZ, no neprechádzal celým produkčným tokom archívu a CCG. Dokonca aj jednoduchý program bez jazykového modelu dosiahol na rovnakých, už pripravených vstupoch ITHZ skóre 72 zo 72. Výsledok tak podporuje prínos prípravy dôveryhodnejšieho kontextu; nemeria všeobecnú inteligenciu ani autonómne objavovanie.

Napriek úzkemu rozsahu je to užitočný stavebný kameň. Ak sa má agent dlhodobo zlepšovať, potrebujeme vedieť, či jeho pamäť uchováva opravy a či odolá aspoň známym spôsobom poškodenia. Lokálne kritérium ochrany pred týmto typom falošného záznamu systém v danom experimente splnil. Také kritérium však nie je percentom dosiahnutej AGI ani oprávnením priradiť ITHZ konkrétnu úroveň v cudzej klasifikácii.

Ďalší pokrok sa dá formulovať oveľa konkrétnejšie než otázkou, koľko nám ešte chýba do AGI. Agent dostane neznáme prostredie, urobí pokus, pozoruje následok, odvodí obmedzené poučenie a využije ho pri odlišnej úlohe. Budeme merať úspešnosť, počet potrebných pokusov, opakovanie chýb, ľudské zásahy a spotrebu. Test musí vedieť odlíšiť naučenie nového vzťahu od opätovného použitia už napísanej odpovede.

Podobný dôraz na osvojovanie nových schopností kladie ARC Prize. V jeho poňatí je podstatná efektívnosť učenia na neznámych úlohách, nie iba nahromadený výkon na známych zadaniach. Ide o ďalšiu konkrétnu definíciu, podľa ktorej môžeme smerovanie agenta hodnotiť. ITHZ zatiaľ takým porovnávacím meraním v tomto experimente neprešlo. Prístup ARC-AGI k meraniu inteligencie

Pre mňa je na tejto ceste najzaujímavejšie, že na nej môžeme pracovať už dnes. Navrhnúť lepšiu pamäť, zachovať dôkaz pri zhrnutí, dopriať oponentovi vlastný prvý úsudok a ukázať agentovi výsledok jeho činnosti sú konkrétne inžinierske úlohy. Každá má overiteľný výstup. Či ich spojenie povedie k vyššej všeobecnosti, musí ukázať správanie celého systému v nových situáciách.

Možno budeme raz na dnešné modely pozerať ako na ranú AGI, ktorá ešte potrebovala dorásť do spoľahlivej praxe. ITHZ skúma časť tejto možnosti: aby sa užitočná skúsenosť zachovala, dostala k ďalšiemu rozhodnutiu a cestou nestratila svoje podmienky platnosti. Najpresvedčivejším ďalším výsledkom bude agent, ktorý pri novej úlohe preukázateľne využije to, čo sa predtým naučil, a zároveň dokáže spoznať, kedy jeho staré poučenie už nestačí.

Reakcia

Ako na vás úvaha pôsobila?

Krátka reakcia mi príde e-mailom. Ak chcete rozvinúť myšlienku verejne, pridajte komentár nižšie.

Diskusia

Komentáre sa zobrazia až po schválení autorom. Pri každom novom komentári príde moderátorovi e-mail.

Zatiaľ tu nie je žiadny schválený komentár.

Pridať komentár

Váš e-mail sa nezverejní. Komentár sa zobrazí až po schválení.