Ce măsurăm, ce nu măsurăm și de ce
Benchmarkul există pentru a fi verificat, nu admirat. Această pagină îi precizează perimetrul exact: ce acoperă cifrele publicate, ce omit deliberat și care dintre capabilitățile noastre nu pot fi reduse onest la un procent.
Ce măsoară benchmarkul
O singură întrebare, pusă asupra unui corpus versionat de proiecte judecate manual: dat fiind un fișier despre care am decis deja, raportează motorul vulnerabilitatea care se află acolo, pe linia corectă, fără a raporta lucruri care nu există?
Ce nu măsoară benchmarkul
Cybseco le livrează. Nicio cifră de pe pagina benchmarkului nu le descrie, și fiecare își poartă motivul. O capabilitate omisă în tăcere este o capabilitate despre care cititorul presupune că a fost acoperită de cifre.
- Dependency vulnerabilities (SCA) — Produced by external scanners that read a live vulnerability database. Their output changes when the database changes, with no change to Cybseco, so a precision figure measured today would describe the database rather than the engine and would not reproduce tomorrow.
- Standalone secret scanning — Gitleaks is an external binary and is not installed for this benchmark. Hardcoded credentials found by Cybseco's own analyzers are measured, inside the code and CI/CD layers, under CWE-798 and CWE-532.
- Third-party SAST (Semgrep, Bandit) — An external ruleset Cybseco orchestrates but does not author. Measuring it would report Semgrep's accuracy, not Cybseco's.
- Licence compliance policy — A policy decision about a project's licences, not a judgement about its code. The corpus labels vulnerabilities, so a licence finding has nothing to be right or wrong against here.
- LLM-assisted analysis — Its output depends on a model and a prompt rather than on the engine, and it is not part of the deterministic result this benchmark measures.
- Graph, attack paths, decision engine — A different kind of claim: these produce paths and plans, not findings, so precision and recall over labelled lines cannot express them. The methodology page explains what could be measured, and which of these cannot honestly be reduced to a percentage at all. Publishing a number before the method is settled is how a benchmark stops being evidence.
De ce unele capabilități nu sunt un procent
Detecția are un răspuns corect: vulnerabilitatea este pe acea linie sau nu este. O parte din ceea ce face Cybseco formulează un alt fel de afirmație, iar precizia și acoperirea nu o pot exprima. A publica totuși o cifră ar fi cel mai ușor lucru de pe această pagină și cea mai rapidă cale de a pierde discuția cu cineva care citește atent.
Cum se citesc cifrele
Patru lucruri de știut înainte de a trage o concluzie din orice cifră singulară de pe pagina benchmarkului.
Regulile la care ne ținem
Acestea sunt constrângeri asupra noastră, nu afirmații despre produs. Ele sunt cele care fac cifrele demne de citit.
- Orice anunță Cybseco este fie măsurat, fie numit pe această pagină ca fiind în afara domeniului. Nu există o a treia stare, iar o poartă automată pică build-ul când un analizor este livrat fără una sau alta.
- Adevărul de referință descrie codul și se decide înainte ca motorul să ruleze. O etichetă scrisă ca să se potrivească cu ieșirea motorului nu este o dovadă.
- O cifră se publică împreună cu eșantionul din care a fost calculată.
- Un defect pe care îl cunoaștem este publicat, nu exclus din metrică. O poartă pică și atunci când un defect publicat încetează în tăcere să se mai reproducă, astfel încât lista poate scădea doar onest.
- Nicio comparație cu alt produs pe capabilități unde noi am alege configurația lor, corpusul lor și scenariul. Nimeni nu ar trebui să creadă o astfel de comparație, nici noi.
- Nicio cifră înainte ca metodologia ei să fie publică și adevărul ei de referință inspectabil.
Vezi cum raționează Cybseco despre un sistem real
Urmărește demonstrația interactivă, apoi solicită o perioadă de probă ghidată pentru echipa ta.