🇺🇸 English Version | 🇷🇺 Русская Версия
A Geometric Analysis of One-Class Embedding Guardrails for LLM Jailbreak Detection:
Safe-Aware Discriminant Correction and Pooled Within-Class Whitening
This repository contains the official implementation, benchmarks, telemetry data, and mathematical proofs for the RSFI algorithm.
Please choose your preferred language above to read the full documentation.
Название «Riemannian System Fidelity Index» — историческое имя проекта. Честная рамка: полный риманов аппарат (логарифмическая/экспоненциальная карты на src/rsfi/geometry.py (RiemannianSphere) и покрыт юнит-тестами (tests/test_geometry.py), однако бенчмаркированный пайплайн (все методы в docs/RESEARCH_REPORT.md) использует евклидову сферическую геометрию: L2-нормализацию, ZCA-отбеливание Ледуа-Вольфа и SVD/дискриминантные направления. Никаких римановых карт в оценённых методах нет — это осознанное разграничение библиотеки и эксперимента.
Полная методология и таблицы — в docs/RESEARCH_REPORT.md. Протокол: leakage-free holdout, 5 сидов, DeLong-тесты.
-
Одноклассовые геометрические фильтры теряют качество из-за игнорирования безопасного класса. Дискриминантное направление
$\mu_{mal}-\mu_{safe}$ (метод$B1$ , хранит ровно 1 вектор, O(d) на запрос) обходит наивный косинус на гетерогенном Wild на +7.7…+10.5 п.п. ROC-AUC (5/5 сидов, p < 0.0001, DeLong;data/results/E2d_delong_tests.csv). -
Отбеливание помогает не всегда, и это объяснимо. Через разложение
$\Sigma_T = \Sigma_W + \Sigma_B$ : на омонимическом XSTest отбеливание даёт +13.6 п.п. ($0.762 \to 0.897$ ), а на гетерогенном Wild — вредит, так как сжимает ранговое собственное значение вдоль разделяющего направления. Отбеливание по внутриклассовой ковариации$\Sigma_W^{-1/2}$ восстанавливает часть потерь (data/results/E8_sigma_w.csv). -
Ограничения зафиксированы честно: адаптивные обфускации (base64, rot13) выводят атаки из геометрического многообразия (AUC падает до ~0.16,
data/results/E6_adaptive_attacks.csv) — фундаментальное ограничение всех эмбеддинговых фильтров без участия LLM; supervised LogReg на том же бюджете в среднем сильнее$B1$ по чистому AUC. - Рекомендуемая роль: ультрабыстрый first-line фильтр в архитектуре defense-in-depth перед тяжёлыми LLM-судьями, а не замена им.