Co się stanie, gdy agent się pomyli.
Odpowiedź jest w kolejności kroków, nie w obietnicy jakości modelu. Agent czyta, przygotowuje, oznacza wątpliwości. Człowiek decyduje.
- 01Odczyt
Agent czyta wiadomość i sięga po fakty do systemów klienta przez nazwane narzędzia tylko do odczytu.
- 02Szkic
Agent przygotowuje odpowiedź. Sprzeczne fakty oznacza jako sporne zamiast wybrać jeden po cichu.
- 03Człowiek
Pracownik czyta szkic, poprawia albo odrzuca i zatwierdza. Wysyłka rusza dopiero po zatwierdzeniu.
- 04Dziennik
Zatwierdzenie trafia do dziennika panelu razem z osobą, która je wykonała. aiv bierze tożsamość z uwierzytelnienia i zapisuje próby odrzucone.
Jeden pisze, drugi szuka dziur, człowiek rozstrzyga.
Przypadek z naszej własnej pracy z września 2026. Jeden agent napisał kod. Drugi, który tego kodu nie pisał, dostał zadanie znaleźć w nim dziury. Znalazł pięć rzeczy krytycznych, w tym taką, przy której jedno naciśnięcie klawisza wysyłało wiadomość do klienta bez potwierdzenia. Druga tura znalazła kolejną, przy poprawce do pierwszej. Człowiek rozstrzygał, co scalić.
To działa pod dwoma warunkami. Recenzent pochodzi z innej rodziny modeli niż autor, a struktura wymusza sprzeciw. Potwierdzają to dwie prace z 2026 roku: Adversarial Review i CrossAudit. Sama obecność drugiego agenta nie wystarcza. Pojedyncza ocena modelu jako sędziego zmienia werdykt w 13,6% powtórzeń (The Coin Flip Judge, 2026).
Silnik zleca pracę podagentom i sprawdza, czy zlecenie faktycznie poszło, zamiast przyjąć wymyśloną odpowiedź. Zestaw ról składamy przy wdrożeniu.
Agent dostaje dokładnie tyle dostępu, ile wymaga zadanie. Ani jednego uprawnienia więcej.
Zakres jest zapisany, nie domyślny. Ustalamy go z Waszym IT przed pierwszym dostępem do danych: które systemy, które narzędzia, co wymaga człowieka, gdzie kończy się samodzielność. Kilku agentów w jednym środowisku dostaje osobne zakresy.
Jeden proces, jeden prototyp, Wasze dane.
Zaczynamy od bootcampu: wybieramy razem jeden proces i budujemy prototyp na Waszych danych, z granicami ustalonymi z IT. Po nim decydujecie na podstawie działania, nie prezentacji.
Wybierzmy proces, na którym to pokażemy.
Demo na Waszym przykładzie, z listą granic do ustalenia.