Mida me mõõdame, mida mitte, ja miks
Võrdlusmõõtmine on olemas selleks, et seda kontrollitaks, mitte imetletaks. See leht sätestab selle täpse perimeetri: mida avaldatud arvud katavad, mida nad tahtlikult välja jätavad, ja millised meie võimekustest ei ole ausalt taandatavad protsendile.
Mida võrdlusmõõtmine mõõdab
Üks küsimus, esitatud versioonitud korpusele käsitsi hinnatud projektidest: kui fail on meil juba otsustatud, kas mootor raporteerib seal oleva haavatavuse, õigel real, raporteerimata asju, mida ei ole?
Mida võrdlusmõõtmine ei mõõda
Cybseco tarnib need. Ükski arv võrdlusmõõtmise lehel ei kirjelda neid, ja igaühel on oma põhjus. Vaikselt välja jäetud võimekus on võimekus, mille lugeja eeldab arvudega kaetud olevat.
- Dependency vulnerabilities (SCA) — Produced by external scanners that read a live vulnerability database. Their output changes when the database changes, with no change to Cybseco, so a precision figure measured today would describe the database rather than the engine and would not reproduce tomorrow.
- Standalone secret scanning — Gitleaks is an external binary and is not installed for this benchmark. Hardcoded credentials found by Cybseco's own analyzers are measured, inside the code and CI/CD layers, under CWE-798 and CWE-532.
- Third-party SAST (Semgrep, Bandit) — An external ruleset Cybseco orchestrates but does not author. Measuring it would report Semgrep's accuracy, not Cybseco's.
- Licence compliance policy — A policy decision about a project's licences, not a judgement about its code. The corpus labels vulnerabilities, so a licence finding has nothing to be right or wrong against here.
- LLM-assisted analysis — Its output depends on a model and a prompt rather than on the engine, and it is not part of the deterministic result this benchmark measures.
- Graph, attack paths, decision engine — A different kind of claim: these produce paths and plans, not findings, so precision and recall over labelled lines cannot express them. The methodology page explains what could be measured, and which of these cannot honestly be reduced to a percentage at all. Publishing a number before the method is settled is how a benchmark stops being evidence.
Miks mõni võimekus ei ole protsent
Tuvastusel on õige vastus: haavatavus on sellel real või ei ole. Osa sellest, mida Cybseco teeb, esitab teistsuguse väite, ja täpsus ega saagis seda väljendada ei suuda. Arvu ikkagi avaldamine oleks kõige lihtsam asi sellel lehel ja kiireim viis kaotada vaidlus kellegagi, kes loeb tähelepanelikult.
Kuidas arve lugeda
Neli asja, mida tasub teada enne, kui teete järelduse mõnest üksikust arvust võrdlusmõõtmise lehel.
Reeglid, mida me endale kehtestame
Need on piirangud meile, mitte väited toote kohta. Just need teevad arvud lugemisväärseks.
- Kõik, mida Cybseco teatab, on kas mõõdetud või sellel lehel nimetatud ulatusest välja jäävaks. Kolmandat olekut ei ole, ja automaatne värav laseb ehitusel läbi kukkuda, kui analüsaator tarnitakse ilma ühe või teiseta.
- Alustõde kirjeldab koodi ja otsustatakse enne mootori käivitamist. Märgend, mis on kirjutatud mootori väljundiga sobitumiseks, ei ole tõendus.
- Arv avaldatakse koos valimiga, millest see arvutati.
- Defekt, mida me teame, avaldatakse, mitte ei jäeta mõõdikust välja. Värav kukub läbi ka siis, kui avaldatud defekt lakkab vaikselt taastekkimast, nii et nimekiri saab kahaneda ainult ausalt.
- Mitte mingit võrdlust teise tootega võimekustel, kus meie valiksime nende konfiguratsiooni, nende korpuse ja stsenaariumi. Sellist võrdlust ei peaks uskuma keegi, ka meie mitte.
- Mitte ühtki arvu enne, kui selle metoodika on avalik ja selle alustõde kontrollitav.
Vaata, kuidas Cybseco reaalse süsteemi üle arutleb
Vaata interaktiivset demo ja seejärel taotle oma meeskonnale juhendatud prooviperioodi.