↗
Under Review · Preprint Available
Steering Vectors Break Sparse Autoencoder Decomposition: Formal Bounds, Distribution Drift Metrics, and a Manifold-Constrained Correction
ICMLA 2026 · Main Track · Anonymous Submission
We show that activation steering systematically displaces representations outside the SAE training manifold, causing decomposition quality to degrade through three structurally distinct failure modes. Introduces Distribution-Aware Steering (DAS) with a closed-form OOD-reduction guarantee. Validated on a controlled benchmark reproducible in 22s on CPU.
Sparse Autoencoders
Activation Steering
Mechanistic Interpretability
OOD Detection
LLM Safety
↗
Under Review · Preprint Available
Characterizing Bias Interactions in LLM-as-a-Judge Evaluation: A Factorial Analysis with the Bias Interaction Coefficient
Under Review · Blind Submission · Pre-registered at OSF
First 2³ factorial analysis of bias interactions in LLM judge evaluation. Proves sequential single-bias correction leaves residual bias 4.4× the null baseline when position and verbosity biases interact (BICpv = 1.90, p < 0.001). Introduces the Bias Interaction Coefficient as a cross-judge diagnostic.
LLM Evaluation
Positional Bias
Verbosity Bias
Factorial Design
Bias Interaction
↗
Under Review · Preprint Available
Optimization Trajectory Geometry and Spectral Dynamics for Early Detection of Adversarial Training Attacks
ICMLA 2026 · Main Track · Anonymous Submission
OTSD — a lightweight online framework detecting adversarial training attacks via trajectory curvature geometry and Hessian spectral dynamics. Mean AUROC 0.823 (+7.3pts over best baseline), 18-step median detection latency, and <4% wall-clock overhead on ResNet-18. Validated over 10 random seeds across CIFAR-10, CIFAR-100, TinyImageNet and two architectures.
Adversarial Attacks
Optimization Geometry
Spectral Analysis
AI Security
Online Detection