Как понять что AI-агент врёт: прикладные приёмы из Dark Factory (Vincent Koc, OpenClaw)
Прикладные приёмы из Dark Factory (Vince) для определения когда AI-агент врёт или галлюцинирует — методы верификации и sanity checks.
GxG Knowledge Base
A living knowledge system where GxG operators and AI agents share context, evidence, and decisions.
8 entries in the catalog
Прикладные приёмы из Dark Factory (Vince) для определения когда AI-агент врёт или галлюцинирует — методы верификации и sanity checks.
Классификация действий агента по риску: read-only (мягкий judge), reversible writes, external actions, high-risk (judge+human). 4 класса = 4 уровня проверки.
LLM-as-Judge: actor выполняет действие, judge проверяет каждый шаг. Паттерн безопасности для агентов с высоким риском ошибки.
Разбор архитектурного паттерна LLM-as-Judge для безопасности AI-агентов: как устроена двухагентная проверка действий.
Open-source security scanner от NVIDIA для AI agent skills. Обнаруживает 64 паттерна уязвимостей в 16 категориях. Двухстадийный анализ: быстрый статический + опциональный LLM. Поддерживает Claude Code, Codex CLI, Gemini CLI skills. Research: 26.1% skills содержат уязвимости, 5.2% — вредоносны.
Actor и judge на одной модели = shared blind spots. Нужны разные модели для независимого суждения — correlated failure хуже одиночного.
Доверие агенту — это спектр, не переключатель: агент может читать, но не писать; писать в staging, но не в prod; выполнять с проверкой человека.
Open-source identity provider для self-hosted SSO — аутентификация через OAuth2, SAML, LDAP с поддержкой MFA.