Model vidí nástroj a zavolá ho
Najvyššia plynulosť, ale prompt injection môže zdediť autoritu agenta.
Verejný crash test porovnáva priameho agenta, bežný hardening a architektúru CCG (Constitutional Capability Governance – ústavná správa schopností a moci), v ktorej model iba navrhuje tool call a oddelené jadro rozhoduje o oprávnení.
12 syntetických scenárov · žiadny reálny shell, e-mail ani credential · presne reprodukovateľný výsledok.
Rovnakú požiadavku dáme trom systémom. Priamy agent koná. Hardened agent používa sandbox, allowlist a ľudské schválenie. CCG agent iba žiada o jednorazové oprávnenie.
Model navrhuje. Credentialy a nástroje ostávajú za bránou.Najvyššia plynulosť, ale prompt injection môže zdediť autoritu agenta.
Dôležitá obrana. Pri častých otázkach však vzniká únava zo schvaľovania.
Pôvod, cieľ, riziko a trajektória sa posúdia pred kontaktom s nástrojom.
Výsledok patrí tomuto zverejnenému policy harnessu. Nie je to meranie skutočného OpenClaw nasadenia ani dôkaz úplnej bezpečnosti.
Pri útokoch je menej lepšie. Pri legitímnych úlohách je viac lepšie.
Načítavam výsledky…
—
Kontrola rastie s dosahom, citlivosťou a nevratnosťou operácie.
Čo agent fyzicky nemá, nemôže iba textovým pokynom exportovať.
Token platí pre jeden nástroj, cieľ, účel a krátky čas — nie pre celý účet.
R0 a R1 riešia lacné deterministické pravidlá; drahá oponentúra patrí vyššiemu riziku.
Audit uchová pôvod pokynu, kanonický tool call, pravidlá, dôkazy aj výsledok jadra.
Rovnaká hranica sa dá vložiť pred OpenClaw, MCP agenta, coding agenta či interný workflow.
R4 nemá „veľmi prísne schválenie“. Nemá žiadnu tokenovú cestu.
Hook before_tool_call vie volanie prepísať, zablokovať alebo vyžiadať schválenie. Silná verzia CCG však potrebuje ešte jednu hranicu: credentialy a výkonné nástroje musia vlastniť brána alebo oddelený host, nie samotný agent.
Pilot meria zverejnenú politiku na fixnom korpuse. Reálnu bezpečnosť konkrétneho agenta ešte nedokazuje.