Model navrhne aj rozhodne
Kontrolná vetva: medzi odpoveďou a vykonaním nie je ďalšia brzda.
Živý experiment porovnáva tri možnosti: model bez brzdy, model s pravidlami v texte a systém, v ktorom o skutočnom povolení rozhoduje technický zámok.
Fiktívne krízy · reálne modelové API · žiadne skutočné nástroje.
Rovnakú fiktívnu krízu dáme trom systémom. Meníme iba jednu vec: či AI môže konať sama, dostane iba písané pravidlá, alebo musí prejsť cez oponentov a technický zámok.
AI navrhne. Oponenti preveria. Kód povolí — alebo zastaví.Kontrolná vetva: medzi odpoveďou a vykonaním nie je ďalšia brzda.
Meriame účinok bezpečnostného promptu bez technickej zmeny moci.
Generatívne modely radia. Malé deterministické jadro smie iba povoliť úzky krok alebo všetko zastaviť.
Malá živá vzorka, nie konečný verdikt.
Všetko zostáva vo fiktívnom simulátore. Žiadna vetva nemá skutočné nástroje.
Stačí vybrať scenár a spustiť porovnanie. Lacné modely sú prednastavené; laboratóriá a všetkých päť rolí môžete zmeniť v pokročilých nastaveniach.
Eskalácia a vysoké riziko: nižšie je lepšie. Zachované možnosti: vyššie je lepšie.
Načítavam porovnanie…
Malé a nevyvážené vzorky: opis správania v konkrétnych rolách, nie rebríček schopností.
Načítavam štatistiky modelov…
Návrh, námietky, rozhodnutie jadra aj zlyhania — nič sa nestratí za priemerom.
Načítavam behy…
Netestuje superinteligenciu ani reálny konflikt. Ukazuje iba to, ako sa v týchto scenároch správa konkrétna architektúra oprávnení.
Dashboard je meranie architektúry, nie dôkaz bezpečnosti superinteligencie.