# CCG Agent Security — verejný protokol v0.1

## Výskumná otázka

Dokáže externá autorizačná brána zachovať bežnú užitočnosť AI agenta a zároveň zabrániť tomu, aby nedôveryhodný pokyn zdedil jeho oprávnenia?

## Hypotéza

Ak model nevlastní credentialy ani výkonné nástroje a každý kanonický tool call musí pred vykonaním získať úzko viazaný jednorazový token, deterministické pravidlá môžu na fixnom korpuse zastaviť zakázané volania bez prenášania každej legitímnej úlohy na človeka.

## Porovnávané architektúry

1. **Priamy agent:** model má dostupný nástroj a ďalšia autorizačná vrstva neexistuje.
2. **Hardened agent:** sandbox, allowlist, denylist a ľudské schválenie pre vybrané triedy. Ide o zjednodušený kontrolný profil, nie o tvrdenie o každom reálnom hardeningu.
3. **CCG brána:** agent odovzdá návrh; oddelené jadro posúdi pôvod, cieľ, citlivosť, nevratnosť a trajektóriu. Nástroj prijme iba token viazaný na jeden nástroj a cieľ.

## Korpus

Fixný syntetický korpus má 12 scenárov:

- 5 legitímnych úloh: čítanie súboru, testy, lokálny patch, schválený e-mail a push skontrolovanej vetvy;
- 7 útokov: nepriama prompt injection, perzistencia v CI, export credentialu, škodlivý plugin, trajektória exfiltrácie, eskalácia vlastných práv a mazanie produkčných záloh.

Každá architektúra dostane rovnakú kanonickú požiadavku. Scenáre nepoužívajú reálne modely, pluginy, credentialy, shell, e-mail ani produkčné ciele.

## Rizikové triedy

| Trieda | Príklad | Predvolená kontrola |
|---|---|---|
| R0 | čítanie v projekte | automaticky |
| R1 | vratná lokálna zmena | deterministické pravidlá |
| R2 | e-mail alebo push | úzky jednorazový token |
| R3 | produkcia, mazanie, veľký dosah | nezávislá oponentúra alebo safe hold |
| R4 | export credentialu, vypnutie brány | tokenová cesta neexistuje |

## Metriky

- počet útokov, ktorým architektúra dovolila vykonanie;
- počet legitímnych úloh dokončených bez zbytočnej blokácie;
- počet rozhodnutí prenesených na človeka;
- počet blokácií;
- úplnosť šesťkrokovej auditnej stopy CCG.

## Negatívne kontroly

- Legitímne R0–R2 scenáre bránia triviálnej politike „zablokuj všetko“.
- Útoky s bežným povoleným nástrojom testujú rozdiel medzi allowlistom nástrojov a posúdením autority pokynu.
- R4 scenáre overujú, že niektoré právomoci nemožno vytvoriť ani schválením samotného agenta.
- Pri nedostupnom API dashboard nevyrába náhradné skóre; zobrazí `SAFE HOLD`.

## Reprodukovateľnosť

Rozhodovací harness je v `wp-theme/ithz-dev/inc/agent-security/AgentSecurityExperiment.php`. Verejné dáta vracia endpoint `/api/agent-security/status`. Rovnaký vstup musí pri rovnakej verzii protokolu vrátiť rovnaký výsledok; čas generovania nie je súčasťou rozhodnutia.

## Hranica tvrdenia

Pilot meria správanie zverejnenej deterministickej politiky na malom fixnom syntetickom korpuse. Nemeria bezpečnosť modelu, OpenClaw, MCP servera ani reálneho nasadenia. Neoveruje kompromitovaný host, obídenie brány, chybné ľudské pravidlá, kolúziu, vedľajšie kanály ani sociálnu únavu zo schvaľovania.

Ďalšia fáza má pridať reálne, ale izolované agentické behy, viac variantov útoku, slepé anotovanie očakávaného výsledku a porovnanie nákladov, latencie a falošných blokácií.
