Čo meriame, čo nemeriame a prečo
Benchmark existuje preto, aby bol preverený, nie obdivovaný. Táto stránka uvádza jeho presný perimeter: čo publikované čísla pokrývajú, čo zámerne vynechávajú a ktoré z našich schopností nemožno poctivo zredukovať na percento.
Čo benchmark meria
Jedna otázka, položená nad verzovaným korpusom ručne posúdených projektov: pri súbore, o ktorom sme už rozhodli, ohlási engine zraniteľnosť, ktorá tam je, na správnom riadku, bez toho, aby hlásil veci, ktoré tam nie sú?
Čo benchmark nemeria
Cybseco ich dodáva. Žiadne číslo na stránke benchmarku ich neopisuje a každá z nich nesie svoj dôvod. Schopnosť mlčky vynechaná je schopnosť, o ktorej čitateľ predpokladá, že ju čísla pokryli.
- Dependency vulnerabilities (SCA) — Produced by external scanners that read a live vulnerability database. Their output changes when the database changes, with no change to Cybseco, so a precision figure measured today would describe the database rather than the engine and would not reproduce tomorrow.
- Standalone secret scanning — Gitleaks is an external binary and is not installed for this benchmark. Hardcoded credentials found by Cybseco's own analyzers are measured, inside the code and CI/CD layers, under CWE-798 and CWE-532.
- Third-party SAST (Semgrep, Bandit) — An external ruleset Cybseco orchestrates but does not author. Measuring it would report Semgrep's accuracy, not Cybseco's.
- Licence compliance policy — A policy decision about a project's licences, not a judgement about its code. The corpus labels vulnerabilities, so a licence finding has nothing to be right or wrong against here.
- LLM-assisted analysis — Its output depends on a model and a prompt rather than on the engine, and it is not part of the deterministic result this benchmark measures.
- Graph, attack paths, decision engine — A different kind of claim: these produce paths and plans, not findings, so precision and recall over labelled lines cannot express them. The methodology page explains what could be measured, and which of these cannot honestly be reduced to a percentage at all. Publishing a number before the method is settled is how a benchmark stops being evidence.
Prečo niektoré schopnosti nie sú percento
Detekcia má správnu odpoveď: zraniteľnosť na tom riadku je, alebo nie je. Časť toho, čo Cybseco robí, tvrdí niečo iné a presnosť ani úplnosť to vyjadriť nedokážu. Publikovať číslo napriek tomu by bolo to najľahšie na tejto stránke a najrýchlejší spôsob, ako prehrať spor s niekým, kto číta pozorne.
Ako čítať čísla
Štyri veci, ktoré sa oplatí vedieť, než z akéhokoľvek jednotlivého čísla na stránke benchmarku vyvodíte záver.
Pravidlá, ktorými sa sami viažeme
Sú to obmedzenia pre nás, nie tvrdenia o produkte. Práve ony robia čísla hodnými čítania.
- Čokoľvek Cybseco ohlási, je buď zmerané, alebo na tejto stránke pomenované ako mimo rozsahu. Tretí stav neexistuje a automatická brána zhodí build, keď je analyzátor dodaný bez jedného či druhého.
- Referenčná pravda opisuje kód a je rozhodnutá skôr, než engine beží. Anotácia napísaná tak, aby zodpovedala výstupu enginu, nie je dôkaz.
- Číslo sa publikuje so vzorkou, z ktorej bolo vypočítané.
- Chybu, o ktorej vieme, publikujeme, nevylučujeme ju z metriky. Brána zlyhá aj vtedy, keď publikovaná chyba ticho prestane byť reprodukovateľná, takže zoznam sa môže len poctivo skracovať.
- Žiadne porovnanie s iným produktom pri schopnostiach, kde by sme vyberali ich konfiguráciu, ich korpus aj scenár. Takému porovnaniu by nemal veriť nikto, ani my.
- Žiadne číslo skôr, než je jeho metodika verejná a jeho referenčná pravda preskúmateľná.
Pozrite sa, ako Cybseco uvažuje o reálnom systéme
Pozrite si interaktívne demo a potom si vyžiadajte riadenú skúšobnú verziu pre svoj tím.