Vad vi mäter, vad vi inte mäter, och varför
Benchmarket finns för att granskas, inte beundras. Den här sidan anger dess exakta perimeter: vad de publicerade siffrorna täcker, vad de medvetet utelämnar, och vilka av våra förmågor som inte ärligt kan reduceras till en procentsats.
Vad benchmarket mäter
En fråga, ställd över ett versionshanterat korpus av handbedömda projekt: givet en fil som vi redan har tagit ställning till, rapporterar motorn den sårbarhet som finns där, på rätt rad, utan att rapportera saker som inte finns?
Vad benchmarket inte mäter
Cybseco levererar dessa. Ingen siffra på benchmarksidan beskriver dem, och var och en bär sitt skäl. En förmåga som utelämnas i tysthet är en förmåga som läsaren antar att siffrorna täckte.
- Dependency vulnerabilities (SCA) — Produced by external scanners that read a live vulnerability database. Their output changes when the database changes, with no change to Cybseco, so a precision figure measured today would describe the database rather than the engine and would not reproduce tomorrow.
- Standalone secret scanning — Gitleaks is an external binary and is not installed for this benchmark. Hardcoded credentials found by Cybseco's own analyzers are measured, inside the code and CI/CD layers, under CWE-798 and CWE-532.
- Third-party SAST (Semgrep, Bandit) — An external ruleset Cybseco orchestrates but does not author. Measuring it would report Semgrep's accuracy, not Cybseco's.
- Licence compliance policy — A policy decision about a project's licences, not a judgement about its code. The corpus labels vulnerabilities, so a licence finding has nothing to be right or wrong against here.
- LLM-assisted analysis — Its output depends on a model and a prompt rather than on the engine, and it is not part of the deterministic result this benchmark measures.
- Graph, attack paths, decision engine — A different kind of claim: these produce paths and plans, not findings, so precision and recall over labelled lines cannot express them. The methodology page explains what could be measured, and which of these cannot honestly be reduced to a percentage at all. Publishing a number before the method is settled is how a benchmark stops being evidence.
Varför vissa förmågor inte är en procentsats
Detektion har ett rätt svar: sårbarheten finns på den raden eller inte. En del av det Cybseco gör gör ett annat slags påstående, och precision och recall kan inte uttrycka det. Att ändå publicera en siffra vore det lättaste på den här sidan att göra, och det snabbaste sättet att förlora diskussionen med någon som läser noggrant.
Hur siffrorna ska läsas
Fyra saker värda att veta innan du drar en slutsats av någon enskild siffra på benchmarksidan.
Reglerna vi håller oss till
Detta är begränsningar på oss, inte påståenden om produkten. De är det som gör siffrorna värda att läsa.
- Allt som Cybseco annonserar är antingen mätt eller namngivet på den här sidan som utanför omfattningen. Det finns inget tredje tillstånd, och en automatiserad grind får bygget att misslyckas när en analysator levereras utan det ena eller det andra.
- Ground truth beskriver koden, beslutad innan motorn körs. En etikett skriven för att matcha motorns utdata är inte bevis.
- En siffra publiceras tillsammans med det urval den beräknades från.
- En defekt vi känner till publiceras, den utesluts inte från måttet. En grind misslyckas också när en publicerad defekt tyst slutar reproduceras, så listan kan bara krympa ärligt.
- Ingen jämförelse mot en annan produkt på förmågor där vi skulle välja deras konfiguration, deras korpus och scenariot. Ingen bör tro på en sådan jämförelse, inte heller vi.
- Ingen siffra innan dess metodik är offentlig och dess ground truth går att granska.
Se Cybseco resonera om ett verkligt system
Se den interaktiva demon och begär sedan en guidad provperiod för ditt team.