Digital Fortress
PillarBlueprintКак понять что AI-агент врёт: прикладные приёмы из Dark Factory (Vincent Koc, OpenClaw)Прикладные приёмы из Dark Factory (Vince) для определения когда AI-агент врёт или галлюцинирует — методы верификации и sanity checks.Blueprint4 класса действий + 4 исхода judge: production-grade классификацияКлассификация действий агента по риску: read-only (мягкий judge), reversible writes, external actions, high-risk (judge+human). 4 класса = 4 уровня проверки.BlueprintLLM-as-Judge: архитектурный паттерн безопасности AI-агентовLLM-as-Judge: actor выполняет действие, judge проверяет каждый шаг. Паттерн безопасности для агентов с высоким риском ошибки.BlueprintNate B. Jones — LLM as Judge: архитектурный паттерн безопасности AI-агентов (полный транскрипт)Разбор архитектурного паттерна LLM-as-Judge для безопасности AI-агентов: как устроена двухагентная проверка действий.ToolNVIDIA SkillSpector — Security Scanner for AI Agent SkillsOpen-source security scanner от NVIDIA для AI agent skills. Обнаруживает 64 паттерна уязвимостей в 16 категориях. Двухстадийный анализ: быстрый статический + опциональный LLM. Поддерживает Claude Code, Codex CLI, Gemini CLI skills. Research: 26.1% skills содержат уязвимости, 5.2% — вредоносны.InsightsCorrelated judgment: почему actor и judge не могут быть одной модельюActor и judge на одной модели = shared blind spots. Нужны разные модели для независимого суждения — correlated failure хуже одиночного.InsightsTrust is not a switch — спектр полномочий для агентовДоверие агенту — это спектр, не переключатель: агент может читать, но не писать; писать в staging, но не в prod; выполнять с проверкой человека.ToolAuthentik — Open-Source Identity Provider for Self-Hosted SSOOpen-source identity provider для self-hosted SSO — аутентификация через OAuth2, SAML, LDAP с поддержкой MFA.