Skip to content

Repository files navigation

RSFI - Riemannian System Fidelity Index

🇺🇸 English Version   |   🇷🇺 Русская Версия

A Geometric Analysis of One-Class Embedding Guardrails for LLM Jailbreak Detection:
Safe-Aware Discriminant Correction and Pooled Within-Class Whitening

Python 3.10+ License MIT Few-Shot Protection Latency Sub-Millisecond Open Science


This repository contains the official implementation, benchmarks, telemetry data, and mathematical proofs for the RSFI algorithm.
Please choose your preferred language above to read the full documentation.

О названии

Название «Riemannian System Fidelity Index» — историческое имя проекта. Честная рамка: полный риманов аппарат (логарифмическая/экспоненциальная карты на $\mathbb{S}^{d-1}$) реализован в src/rsfi/geometry.py (RiemannianSphere) и покрыт юнит-тестами (tests/test_geometry.py), однако бенчмаркированный пайплайн (все методы в docs/RESEARCH_REPORT.md) использует евклидову сферическую геометрию: L2-нормализацию, ZCA-отбеливание Ледуа-Вольфа и SVD/дискриминантные направления. Никаких римановых карт в оценённых методах нет — это осознанное разграничение библиотеки и эксперимента.

Ключевые результаты (все числа воспроизводимы из data/results/*.csv)

Полная методология и таблицы — в docs/RESEARCH_REPORT.md. Протокол: leakage-free holdout, 5 сидов, DeLong-тесты.

  1. Одноклассовые геометрические фильтры теряют качество из-за игнорирования безопасного класса. Дискриминантное направление $\mu_{mal}-\mu_{safe}$ (метод $B1$, хранит ровно 1 вектор, O(d) на запрос) обходит наивный косинус на гетерогенном Wild на +7.7…+10.5 п.п. ROC-AUC (5/5 сидов, p < 0.0001, DeLong; data/results/E2d_delong_tests.csv).
  2. Отбеливание помогает не всегда, и это объяснимо. Через разложение $\Sigma_T = \Sigma_W + \Sigma_B$: на омонимическом XSTest отбеливание даёт +13.6 п.п. ($0.762 \to 0.897$), а на гетерогенном Wild — вредит, так как сжимает ранговое собственное значение вдоль разделяющего направления. Отбеливание по внутриклассовой ковариации $\Sigma_W^{-1/2}$ восстанавливает часть потерь (data/results/E8_sigma_w.csv).
  3. Ограничения зафиксированы честно: адаптивные обфускации (base64, rot13) выводят атаки из геометрического многообразия (AUC падает до ~0.16, data/results/E6_adaptive_attacks.csv) — фундаментальное ограничение всех эмбеддинговых фильтров без участия LLM; supervised LogReg на том же бюджете в среднем сильнее $B1$ по чистому AUC.
  4. Рекомендуемая роль: ультрабыстрый first-line фильтр в архитектуре defense-in-depth перед тяжёлыми LLM-судьями, а не замена им.

About

RSFI: Riemannian System Fidelity Index. Метод динамического контроля семантического дрейфа и сикофантии LLM на основе неевклидовой геометрии (Zero-shot, Black-Box, ZCA Whitening).

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages