Zestien ervaren ontwikkelaars, 246 taken, toegang tot AI. De uitkomst was vermoedelijk niet wat je bij die ingrediënten verwacht: met de onderzochte hulpmiddelen deden de ontwikkelaars gemiddeld 19 procent langer over hun werk.
Dat rapporteerde onderzoeksorganisatie METR in juli 2025. De deelnemers werkten aan bestaande projecten die ze goed kenden. Het ging om tools uit de eerste helft van dat jaar. Wie het resultaat aanhaalt, moet die omstandigheden erbij houden. Anders verandert een experiment onder ervaren ontwikkelaars ongemerkt in een uitspraak over iedereen die AI gebruikt. S1
De verleiding om dat toch te doen is begrijpelijk. Zo’n percentage biedt houvast in een gesprek waarin mensen heel verschillende ervaringen hebben. Alleen heeft METR inmiddels zelf uitgelegd waarom een nieuwe meting lastiger werd. Dat vervolg verdient minstens zoveel aandacht als het oorspronkelijke getal.
De mensen die niet meer mee willen doen
In de update van februari 2026 beschrijft METR een probleem met de selectie. Ontwikkelaars wilden minder graag meedoen als dat betekende dat zij een deel van hun taken zonder AI moesten uitvoeren. Ook de keuze van aangemelde taken speelde mee. Daarnaast was de vergoeding veranderd en werd tijdmeten ingewikkelder voor deelnemers die met meerdere agents tegelijk werkten. De onderzoekers vonden hun nieuwe gegevens daarom geen betrouwbare maat voor het actuele productiviteitseffect. S2
Hier zit een lastige knoop. Juist wie veel voordeel verwacht van AI, kan minder bereid zijn om voor een experiment zonder te werken. Een vervolgmeting kan daardoor een ander soort deelnemer of een ander soort taak bevatten. Het onderzoeksontwerp beïnvloedt dan welke ervaringen überhaupt in de uitkomst terechtkomen.
Dat betekent niet dat het eerdere resultaat onjuist was. Je kunt een afgebakende situatie zorgvuldig meten en bij een volgende meting toch ontdekken dat de omstandigheden zijn verschoven. Het oude percentage blijft een bevinding over die eerdere situatie. Het wordt er geen actuele voorspelling van.
Voor een team dat zelf een proef wil doen, is dit meteen een praktisch probleem. Als mensen alleen taken aanmelden waarvoor ze best zonder AI kunnen, wat onderzoek je dan? Noteer daarom ook welke taken buiten de vergelijking blijven en waarom. Die lijst kan iets blootleggen wat in de gemiddelde tijd niet te zien is.
Een ander beroep, een andere uitkomst
Vergelijk dit met een studie naar AI-ondersteuning bij klantenservice. Het abstract van versie 2 van Generative AI at Work beschrijft 5.172 medewerkers. Bij de gefaseerde invoering van een AI-assistent steeg het aantal opgeloste kwesties per uur gemiddeld met 15 procent. De effecten verschilden naar ervaring. S3
Dat resultaat spreekt het METR-experiment niet tegen. Een klantvraag afhandelen is een andere taak dan een wijziging aanbrengen in een vertrouwde codebase. Bovendien zijn tijd per ontwikkeltaak en opgeloste klantvragen per uur verschillende uitkomstmaten. Twee percentages naast elkaar zetten geeft nog geen vergelijking van hetzelfde werk.
Je kunt er wel een gerichtere vraag aan ontlenen: welke onderdelen van onze taak lijken op de onderzochte situatie? Een beginnende medewerker die hulp zoekt bij een onbekend probleem heeft mogelijk iets anders nodig dan een ervaren collega die een uitzondering probeert op te lossen. Dat is een vraag voor onderzoek, geen effect dat je alvast mag invullen.
Waar eindigt de taak?
Daar komt nog een keuze bij die ieder team zelf moet maken. Stel dat je AI gebruikt om een voorstel te schrijven. Meet je tot het concept op het scherm staat, tot iemand de aannames heeft gecontroleerd, of tot de ontvanger een besluit kan nemen?
Dat voorbeeld is geen kritiek op hoe METR of de klantenservicestudie heeft gemeten. Het laat zien dat je eerst moet bepalen welke uitkomst je voor je eigen beslissing nodig hebt. Een prima onderzoeksresultaat kan een andere vraag beantwoorden dan de vraag die jij hebt.
Het zou zonde zijn om al dit onderzoek dan maar terzijde te schuiven omdat geen enkele studie precies jouw organisatie nabootst. Gebruik het om je vergelijking scherper te maken. Schrijf de taak op, leg vast wat afgerond werk is en vermeld wie of wat buiten de meting valt. Pas dan krijgt het percentage een adres.
Bij de METR-studie hoort voorlopig dit adres: ervaren ontwikkelaars, bekende projecten, onderzochte tools uit begin 2025. Het vervolg laat vooral zien hoeveel werk ervoor nodig is om dat adres te wijzigen.
