Mit mérünk, mit nem, és miért
A benchmark azért létezik, hogy ellenőrizzék, nem azért, hogy csodálják. Ez az oldal megadja a pontos határait: mit fednek le a közzétett számok, mit hagynak ki szándékosan, és mely képességeink nem redukálhatók tisztességesen egy százalékra.
Mit mér a benchmark
Egyetlen kérdés, kézzel megítélt projektek verziózott korpuszán feltéve: egy fájl esetében, amelyről már döntöttünk, jelenti-e a motor az ott lévő sebezhetőséget, a megfelelő soron, anélkül, hogy olyat jelentene, ami nincs ott?
Mit nem mér a benchmark
A Cybseco szállítja ezeket. A benchmark oldalán egyetlen szám sem írja le őket, és mindegyikhez tartozik az indoklása. A hallgatólagosan kihagyott képesség olyan képesség, amelyről az olvasó azt feltételezi, hogy a számok lefedték.
- Dependency vulnerabilities (SCA) — Produced by external scanners that read a live vulnerability database. Their output changes when the database changes, with no change to Cybseco, so a precision figure measured today would describe the database rather than the engine and would not reproduce tomorrow.
- Standalone secret scanning — Gitleaks is an external binary and is not installed for this benchmark. Hardcoded credentials found by Cybseco's own analyzers are measured, inside the code and CI/CD layers, under CWE-798 and CWE-532.
- Third-party SAST (Semgrep, Bandit) — An external ruleset Cybseco orchestrates but does not author. Measuring it would report Semgrep's accuracy, not Cybseco's.
- Licence compliance policy — A policy decision about a project's licences, not a judgement about its code. The corpus labels vulnerabilities, so a licence finding has nothing to be right or wrong against here.
- LLM-assisted analysis — Its output depends on a model and a prompt rather than on the engine, and it is not part of the deterministic result this benchmark measures.
- Graph, attack paths, decision engine — A different kind of claim: these produce paths and plans, not findings, so precision and recall over labelled lines cannot express them. The methodology page explains what could be measured, and which of these cannot honestly be reduced to a percentage at all. Publishing a number before the method is settled is how a benchmark stops being evidence.
Miért nem százalék némelyik képesség
Az észlelésnek van helyes válasza: a sebezhetőség azon a soron van, vagy nincs. Amit a Cybseco részben csinál, az másfajta állítás, és a precizitás és a fedés ezt nem tudja kifejezni. Mégis közzétenni egy számot lenne a legkönnyebb ezen az oldalon, és a leggyorsabb módja annak, hogy elveszítsük a vitát valakivel, aki figyelmesen olvas.
Hogyan olvassuk a számokat
Négy dolog, amit érdemes tudni, mielőtt bármely egyedi számból következtetést vonna le a benchmark oldalán.
Szabályok, amelyekhez tartjuk magunkat
Ezek ránk vonatkozó megszorítások, nem a termékről szóló állítások. Éppen ezek teszik a számokat olvasásra érdemessé.
- Bármit, amit a Cybseco bejelent, vagy megmértük, vagy ezen az oldalon hatókörön kívüliként neveztük meg. Harmadik állapot nincs, és egy automatikus kapu elbuktatja a buildet, ha egy elemző e kettő egyike nélkül kerül szállításra.
- A referenciaigazság a kódot írja le, és a motor futtatása előtt dől el. A motor kimenetéhez igazított címke nem bizonyíték.
- Egy számot azzal a mintával együtt teszünk közzé, amelyből számoltuk.
- Az általunk ismert hibát közzétesszük, nem zárjuk ki a mérőszámból. A kapu akkor is elbukik, ha egy közzétett hiba csendben megszűnik reprodukálódni, így a lista csak tisztességesen rövidülhet.
- Semmilyen összehasonlítás más termékkel olyan képességeken, ahol mi választanánk meg az ő konfigurációjukat, az ő korpuszukat és a forgatókönyvet. Ilyen összehasonlításnak senki sem hihet, mi sem.
- Semmilyen szám, mielőtt a módszertana nyilvános és a referenciaigazsága megvizsgálható lenne.
Nézze meg, ahogy a Cybseco egy valós rendszerről következtet
Nézze meg az interaktív demót, majd igényeljen vezetett próbát a csapatának.