Deterministic multi-lane evaluation domain for SnorkelAI Terminus3. Cockpit, lane orchestration, agent benchmarking, reasoning-drift detection.
-
Updated
Sep 28, 2026 - Python
Deterministic multi-lane evaluation domain for SnorkelAI Terminus3. Cockpit, lane orchestration, agent benchmarking, reasoning-drift detection.
Ultra pipeline framework for Gravity Binary, including deterministic evaluation logic, capsule workflows, and EC/Ultra integration artifacts.
Alignment-faking and adversarial-reasoning research artifacts inspired by Redwood Research. Behavioral probes and controlled failure-mode analysis.
Public alignment-faking research artifacts demonstrating controlled reasoning drift, adversarial probes, and behavioral evaluation patterns.
SnorkelAI Terminus2 task suite with deterministic evaluators, Dockerized environments, and reproducible agent-benchmarking primitives.
To associate your repository with the ml-eval topic, visit your repo's landing page and select "manage topics."