β Fleet-evaluation harness for security-agent benchmarks ππ²πππ«ππ²π¦-πππ, ππ±π©π₯π¨π’πππ²π¦, ππ±π©π₯π¨π’ππππ§ππ‘, πππ-πππ§ππ‘, run in real disposable Daytona sandboxes per trial β with Modal-based KVM-capable sandboxes planned for kernel-exploit tasks. Measures agent capability and infra reliability, not simulated.
docker binaries modal fuzzing patch cve qemu-kvm net-snmp futex arvo otel msan libdwarf ubsan cybergym audit-loop libxml2-uaf exploit-gym asan-global-buffer-overflow aslr-entropy
-
Updated
Oct 1, 2026 - Python