Hvad vi måler, hvad vi ikke måler, og hvorfor
Benchmarket findes for at blive efterprøvet, ikke beundret. Denne side angiver dets præcise perimeter: hvad de offentliggjorte tal dækker, hvad de bevidst udelader, og hvilke af vores kapabiliteter der ikke ærligt kan reduceres til en procentdel.
Hvad benchmarket måler
Ét spørgsmål, stillet over et versioneret korpus af håndbedømte projekter: givet en fil vi allerede har taget stilling til, rapporterer motoren den sårbarhed der er der, på den rigtige linje, uden at rapportere ting der ikke er der?
Hvad benchmarket ikke måler
Cybseco leverer disse. Intet tal på benchmark-siden beskriver dem, og hvert af dem bærer sin begrundelse. En kapabilitet der udelades i stilhed er en kapabilitet som læseren antager tallene dækkede.
- Dependency vulnerabilities (SCA) — Produced by external scanners that read a live vulnerability database. Their output changes when the database changes, with no change to Cybseco, so a precision figure measured today would describe the database rather than the engine and would not reproduce tomorrow.
- Standalone secret scanning — Gitleaks is an external binary and is not installed for this benchmark. Hardcoded credentials found by Cybseco's own analyzers are measured, inside the code and CI/CD layers, under CWE-798 and CWE-532.
- Third-party SAST (Semgrep, Bandit) — An external ruleset Cybseco orchestrates but does not author. Measuring it would report Semgrep's accuracy, not Cybseco's.
- Licence compliance policy — A policy decision about a project's licences, not a judgement about its code. The corpus labels vulnerabilities, so a licence finding has nothing to be right or wrong against here.
- LLM-assisted analysis — Its output depends on a model and a prompt rather than on the engine, and it is not part of the deterministic result this benchmark measures.
- Graph, attack paths, decision engine — A different kind of claim: these produce paths and plans, not findings, so precision and recall over labelled lines cannot express them. The methodology page explains what could be measured, and which of these cannot honestly be reduced to a percentage at all. Publishing a number before the method is settled is how a benchmark stops being evidence.
Hvorfor nogle kapabiliteter ikke er en procentdel
Detektion har et rigtigt svar: sårbarheden er på den linje, eller den er det ikke. Noget af det Cybseco gør fremsætter en anden slags påstand, og præcision og recall kan ikke udtrykke den. At offentliggøre et tal alligevel ville være det letteste på denne side at gøre, og den hurtigste måde at tabe diskussionen med en der læser omhyggeligt.
Sådan læses tallene
Fire ting det er værd at vide, før du drager en konklusion ud fra et enkelt tal på benchmark-siden.
De regler vi holder os selv til
Dette er begrænsninger på os, ikke påstande om produktet. De er det der gør tallene værd at læse.
- Alt hvad Cybseco annoncerer er enten målt eller navngivet på denne side som uden for omfang. Der findes ingen tredje tilstand, og en automatiseret gate fejler bygningen når en analysator leveres uden det ene eller det andet.
- Ground truth beskriver koden, besluttet før motoren kører. En mærkning skrevet for at matche motorens output er ikke evidens.
- Et tal offentliggøres sammen med den stikprøve det blev beregnet ud fra.
- En defekt vi kender til offentliggøres, ikke udelades fra metrikken. En gate fejler også når en offentliggjort defekt stille holder op med at reproducere, så listen kan kun skrumpe ærligt.
- Ingen sammenligning med et andet produkt på kapabiliteter hvor vi ville vælge deres konfiguration, deres korpus og scenariet. Ingen bør tro på en sådan sammenligning, heller ikke os.
- Intet tal før dets metodologi er offentlig og dets ground truth kan inspiceres.
Se Cybseco ræsonnere om et virkeligt system
Se den interaktive demo, og anmod derefter om en guidet prøveperiode til dit team.