Nu kunstmatige intelligentie steeds vaker wordt opgevoerd als de volgende grote versneller van softwarebeveiliging, groeit in de cryptosector tegelijk de verleiding om te geloven dat menselijk oordeel binnenkort kan worden ingeruild voor geautomatiseerde codejagers. Precies dat optimisme komt nu onder druk te staan, nadat onderzoekers van BlockSec de veelbesproken benchmark EVMbench opnieuw tegen het licht hebben gehouden en tot een veel soberder conclusie komen over wat AI vandaag werkelijk kan in smart contract auditing. De oorspronkelijke benchmark van OpenAI en Paradigm presenteerde indrukwekkende cijfers, met detectie van maximaal 45,6 procent van de kwetsbaarheden en succesvolle exploitatie van 72,2 procent binnen een geselecteerde deelset, maar die uitkomsten blijken volgens de heranalyse minder eenvoudig te vertalen naar de rommelige realiteit van echte aanvallen.
De kern van de kritiek zit in de testopzet, omdat BlockSec stelt dat EVMbench te smal keek naar agentconfiguraties en tegelijk werkte met kwetsbaarheden uit eerder gepubliceerde auditomgevingen die mogelijk al in de trainingsdata van modellen waren beland. In de herbeoordeling werd daarom opgeschaald naar 26 model en scaffold combinaties, verspreid over meerdere modelfamilies, zodat beter zichtbaar werd of prestaties voortkwamen uit het model zelf of uit de manier waarop het agentsysteem was opgebouwd. Daar bovenop voegden de onderzoekers een nieuwe dataset toe met 22 echte beveiligingsincidenten van na medio februari 2026, expliciet gekozen buiten de trainingsvensters van de geteste modellen, om te voorkomen dat voorkennis de resultaten zou vervuilen.
Daar sloeg het beeld hard om, want over 110 agent incident combinaties lukte geen enkele end to end exploitatie, ondanks het feit dat sommige systemen kwetsbaarheden wel degelijk gedeeltelijk konden herkennen. Die uitkomst ondermijnt de gedachte dat automatische exploitatie van echte smart contracts al bijna routine is, en laat zien dat er een groot verschil bestaat tussen het herkennen van bekende patronen en het succesvol uitnutten van complexe praktijksituaties onder realistische omstandigheden. De onderzoekers zagen wel dat AI bruikbaar blijft als eerste filter, vooral bij vaker voorkomende foutpatronen, maar noteerden tegelijk dat meerdere incidenten door geen enkele agent werden gevonden en dat sommige slechts door één systeem werden opgemerkt.
Daarmee verschuift de echte discussie van vervanging naar samenwerking, omdat de waarde van AI in auditwerk voorlopig vooral lijkt te liggen in breedte, snelheid en systematische scanning, niet in diep protocolbegrip of tegenstanders denken zoals ervaren beveiligingsonderzoekers dat doen. OpenAI en Paradigm hebben met EVMbench zonder twijfel een belangrijk meetinstrument neergezet voor de sector, maar de BlockSec studie maakt duidelijk dat de sprong van benchmarksucces naar autonome beveiligingsmacht voorlopig te groot is om serieus als voldongen feit te verkopen. Voor blockchainprojecten en auditfirma’s ligt de les in het beter combineren van machinekracht en menselijke input, omdat in die combinatie de sterkste verdedigingslinie tegen dure codefouten lijkt te ontstaan.
Disclaimer: Dit artikel is uitsluitend bedoeld als journalistieke en informatieve duiding. Het vormt geen beleggingsadvies, juridisch advies of technisch belastingadvies, mede omdat ontwikkelingen rond blockchain, digitale activa en belastingwetten snel kunnen veranderen.
Volg de Facebookpagina and Youtube kanaal voor data, nieuws en inspiratie. Voor alle nieuws uit Suriname en de wereld check: www.kowchecking.com