Mitä mittaamme, mitä emme, ja miksi
Vertailu on olemassa tarkistettavaksi, ei ihailtavaksi. Tämä sivu ilmoittaa sen tarkan kehän: mitä julkaistut luvut kattavat, mitä ne tarkoituksella jättävät pois, ja mitkä kyvykkyytemme eivät rehellisesti taivu prosenttiluvuksi.
Mitä vertailu mittaa
Yksi kysymys, esitettynä versioidulle korpukselle käsin arvioituja projekteja: kun tiedostosta on jo tehty päätös, raportoiko moottori siinä olevan haavoittuvuuden, oikealla rivillä, raportoimatta asioita joita ei ole?
Mitä vertailu ei mittaa
Cybseco toimittaa nämä. Mikään vertailusivun luku ei kuvaa niitä, ja jokaisella on perustelunsa. Hiljaisuudessa pois jätetty kyvykkyys on kyvykkyys jonka lukija olettaa lukujen kattaneen.
- Dependency vulnerabilities (SCA) — Produced by external scanners that read a live vulnerability database. Their output changes when the database changes, with no change to Cybseco, so a precision figure measured today would describe the database rather than the engine and would not reproduce tomorrow.
- Standalone secret scanning — Gitleaks is an external binary and is not installed for this benchmark. Hardcoded credentials found by Cybseco's own analyzers are measured, inside the code and CI/CD layers, under CWE-798 and CWE-532.
- Third-party SAST (Semgrep, Bandit) — An external ruleset Cybseco orchestrates but does not author. Measuring it would report Semgrep's accuracy, not Cybseco's.
- Licence compliance policy — A policy decision about a project's licences, not a judgement about its code. The corpus labels vulnerabilities, so a licence finding has nothing to be right or wrong against here.
- LLM-assisted analysis — Its output depends on a model and a prompt rather than on the engine, and it is not part of the deterministic result this benchmark measures.
- Graph, attack paths, decision engine — A different kind of claim: these produce paths and plans, not findings, so precision and recall over labelled lines cannot express them. The methodology page explains what could be measured, and which of these cannot honestly be reduced to a percentage at all. Publishing a number before the method is settled is how a benchmark stops being evidence.
Miksi jotkin kyvykkyydet eivät ole prosenttiluku
Havaitsemisella on oikea vastaus: haavoittuvuus on sillä rivillä tai ei ole. Osa siitä mitä Cybseco tekee esittää toisenlaisen väitteen, eivätkä tarkkuus ja saanti pysty ilmaisemaan sitä. Luvun julkaiseminen siitä huolimatta olisi helpointa tällä sivulla, ja nopein tapa hävitä väittely tarkasti lukevan kanssa.
Miten lukuja luetaan
Neljä asiaa jotka kannattaa tietää ennen kuin teet johtopäätöksen mistään yksittäisestä vertailusivun luvusta.
Säännöt joihin sidomme itsemme
Nämä ovat rajoitteita meille, eivät väitteitä tuotteesta. Ne tekevät luvuista lukemisen arvoisia.
- Kaikki mitä Cybseco ilmoittaa on joko mitattu tai nimetty tällä sivulla laajuuden ulkopuoliseksi. Kolmatta tilaa ei ole, ja automaattinen portti kaataa buildin kun analysaattori toimitetaan ilman jompaakumpaa.
- Ground truth kuvaa koodia, päätettynä ennen kuin moottori ajetaan. Merkintä joka on kirjoitettu vastaamaan moottorin tulostetta ei ole näyttöä.
- Luku julkaistaan sen otoksen kanssa josta se laskettiin.
- Tuntemamme vika julkaistaan, ei suljeta pois mittarista. Portti kaatuu myös kun julkaistu vika lakkaa hiljaisuudessa toistumasta, joten lista voi kutistua vain rehellisesti.
- Ei vertailua toiseen tuotteeseen kyvykkyyksillä joissa me valitsisimme heidän kokoonpanonsa, heidän korpuksensa ja skenaarion. Kenenkään ei pitäisi uskoa sellaista vertailua, emme mekään.
- Ei lukua ennen kuin sen menetelmä on julkinen ja sen ground truth tarkastettavissa.
Näe Cybseco päättelemässä todellisesta järjestelmästä
Katso interaktiivinen demo ja pyydä sitten opastettu kokeilu tiimillesi.