Er veranderde iets in het AI-landschap in het eerste kwartaal van 2026. Het was niet één modeluitgave of een doorbraak in de benchmark – het was de stille opkomst van AI-agenten die in staat waren om meerdaagse, uit meerdere stappen bestaande werkprojecten te voltooien met minimaal menselijk toezicht. De verandering is zo geleidelijk gegaan dat veel organisaties deze nog niet volledig hebben geregistreerd. Maar de implicaties voor het kenniswerk zijn net zo belangrijk als welke technologische verschuiving dan ook in het afgelopen decennium.
Wat autonome agenten nu kunnen doen
De huidige generatie agenten – gebouwd bovenop modellen als GPT-5, Claude 4 en Gemini Ultra 2 – kan op internet surfen, code schrijven en uitvoeren, bestanden beheren, e-mails verzenden en coördineren met externe API’s. Belangrijker nog is dat ze deze dingen uren of dagen achter elkaar kunnen doen, waarbij ze de context behouden en hun aanpak aanpassen wanneer ze obstakels tegenkomen.
Het belangrijkste vermogen dat de agenten van 2026 onderscheidt van eerdere pogingen is betrouwbare taakdecompositie. Eerdere agentframeworks – AutoGPT, BabyAGI, vroege versies van LangChain-agents – verloren vaak hun doel uit het oog, kwamen vast te zitten in loops of maakten catastrofale fouten die uren werk teniet deden. De huidige agenten, vooral degenen die zijn gebouwd op de uitgebreide denkmogelijkheden van GPT-5 en Claude 4, splitsen complexe taken op in betrouwbare substappen en herstellen probleemloos van mislukkingen.
Implementaties in de echte wereld
Verschillende Fortune 500-bedrijven hebben stilletjes autonome agenten ingezet voor taken als het verzamelen van concurrentiegegevens, het beoordelen van de eerste conceptcontracten, het onderhoud van de datapijplijn en het beoordelen van escalatie van klantenondersteuning. In beide gevallen werken de agenten met een 'human in the loop'-controlepuntsysteem, maar in de praktijk keuren mensen de output van agenten goed in plaats van ze te sturen.
Een middelgroot advocatenkantoor in Sydney meldde dat hun contractbeoordelingsagent – gebouwd op Claude 4 met op maat gemaakte juridische documenttools – nu de eerste doorgang van alle standaard commerciële overeenkomsten afhandelt, waarbij ongebruikelijke clausules worden gemarkeerd en de belangrijkste termen worden samengevat. Het bedrijf schat dat het de tijd die junior medewerkers besteden aan routinematige contractbeoordeling met 70% heeft verminderd, terwijl de partners die de resultaten van de agent hebben beoordeeld, zeiden dat de nauwkeurigheid vergelijkbaar was met die van een tweedejaars medewerker.
Op het gebied van softwareontwikkeling zetten bedrijven als Cognition (makers van de Devin-agent), Cursor en GitHub agents in die een GitHub-probleem kunnen aanpakken, de oplossing kunnen schrijven, de tests kunnen uitvoeren en een pull-verzoek kunnen openen - allemaal zonder menselijke tussenkomst. Uit de gepubliceerde benchmarks van Cognition blijkt dat Devin 13,86% van de echte GitHub-problemen end-to-end oplost, een cijfer dat sinds de lancering van het product elke zes maanden ongeveer verdubbelt.
De productiviteitscijfers
Vroege gegevens van bedrijven die autonome agenten gebruiken, suggereren een productiviteitswinst van 40-60% voor kenniswerkers in getroffen functies. Maar de verdeling is ongelijk: senior werknemers die de output van agenten effectief kunnen aansturen en beoordelen, zien de grootste winst, terwijl junior werknemers wier primaire waarde uitvoering was, hun rol fundamenteel in twijfel trekken.
Uit een onderzoek dat in maart 2026 door de Work of the Future-taskforce van MIT werd gepubliceerd, bleek dat werknemers die AI-agenten gebruiken, aangaven aanzienlijk meer tijd te besteden aan taken die beoordelingsvermogen, relatiebeheer en creatieve probleemoplossing vereisen – en aanzienlijk minder tijd aan het verzamelen van informatie, opmaak en routinematige communicatie. Of dit daadwerkelijke bijscholing betekent of eenvoudigweg een verschuiving waarbij taken menselijk blijven, is een vraag waarover de onderzoeksgemeenschap actief debatteert.
De bestuurskloof
De technologie heeft de bestuurskaders voorbijgestreefd. De meeste bedrijven die autonome agenten inzetten, hebben geen formeel beleid dat bepaalt wat agenten wel en niet kunnen doen, hoe hun resultaten worden gecontroleerd of wie verantwoordelijk is als zij gevolgfouten maken. Het wordt steeds dringender om deze kloof te dichten.
De belangrijkste risico's zijn geen dramatische mislukkingen (agenten die zich bedriegen of duidelijke schade aanrichten), maar subtiele fouten die zich in de loop van de tijd verergeren. Een agent die consequent enigszins optimistische aannames doet in financiële modellen, of die systematisch een bepaald type contractclausule verkeerd interpreteert, kan aanzienlijke schade aanrichten voordat het patroon wordt ontdekt. Menselijke toezichtsystemen die zijn ontworpen voor menselijke werknemers zijn niet goed gekalibreerd om deze faalwijzen op te vangen.
De EU AI Act, die in 2026 volledig van kracht werd, classificeert autonome agenten die worden gebruikt in domeinen met een hoog risico – juridisch, medisch, financieel – als AI-systemen met een hoog risico die conformiteitsbeoordelingen en mechanismen voor menselijk toezicht vereisen. De naleving is fragmentarisch en de handhaving heeft de implementatie nog niet ingehaald.
Wat daarna komt
Het traject is duidelijk: agenten zullen capabeler, betrouwbaarder en breder inzetbaar worden. De vraag voor organisaties is niet of ze met deze technologie moeten omgaan, maar hoe ze dat moeten doen op een manier die de productiviteitsvoordelen benut en tegelijkertijd de risico's beheert. Dat vereist bestuurskaders, audit trails en mechanismen voor menselijk toezicht die de meeste organisaties nog niet hebben opgebouwd.
Voor werknemers is de meest duurzame vaardigheid het vermogen om de output van agenten te sturen, te evalueren en er verantwoordelijkheid voor te nemen. Hiervoor is diepgaande domeinexpertise vereist, en niet alleen technische bekendheid met AI-tools. De werknemers die zullen gedijen zijn degenen die kunnen zien wanneer een agent ongelijk heeft, en niet alleen degenen die een agent kunnen vertellen wat hij moet doen.
Bronnen en verder lezen
- Cognition AI - Devin SWE-bench technisch rapport en methodologie
- MIT Work of the Future – onderzoek naar de impact van AI op arbeidsmarkten en kenniswerk
- Europese Commissie – Regelgevingskader van de EU AI Act en vereisten voor AI-systemen met een hoog risico
- Antropisch onderzoek - Claude's uitgebreide documentatie over denk- en agentvaardigheden
- arXiv — SWE-agent: Agent-computerinterfaces maken geautomatiseerde software-engineering mogelijk