AI verslaat CPA's bij boekhouden, maar toezicht blijft nodig
AI-modellen voeren gestructureerd boekhoudwerk inmiddels sneller, nauwkeuriger en veel goedkoper uit dan opgeleide accountants. Dat is de belangrijkste uitkomst van een nieuw onderzoek van Mercor. Hetzelfde onderzoek laat ook zien dat deze systemen nog altijd geen volledige boekhoudcyclus kunnen afronden zonder dat een mens het werk controleert.
De twee bevindingen wijzen elk een andere kant op, en ze zijn allebei belangrijk. Hieronder lees je wat het onderzoek heeft gemeten, wat het buiten beschouwing liet en waarom het eigenlijke verhaal in het verschil tussen die twee zit.
De directe vergelijking
Mercor wierf 12 gecertificeerde CPA's. CPA staat voor certified public accountant, de belangrijkste beroepskwalificatie voor accountants in de Verenigde Staten. De deelnemers hadden gemiddeld vijfenhalf jaar ervaring. Ze werkten vereenvoudigde taken af uit de APEX Accounting Benchmark, de testreeks van Mercor voor boekhoudwerk.
Mensen scoorden op deze taken gemiddeld zo'n 37 procent. Achttien maanden geleden bleven zelfs de sterkste AI-modellen daar nog onder. Volgens Mercor lossen de beste modellen dezelfde set taken nu vrijwel foutloos op.
In die periode gingen de machines van achterblijven bij ervaren professionals naar duidelijk beter presteren dan zij, op dit smalle onderdeel van het vak. Mercor meldt dat de modellen ook sneller waren en per taak veel minder kostten.
De volledige benchmark vertelt een ander verhaal
De vereenvoudigde taken vormen maar een klein deel van APEX Accounting. De volledige benchmark bestaat uit 160 taken, verdeeld over 10 gesimuleerde bedrijven. Meer dan 40 professionals hebben eraan gebouwd, met gemiddeld 11 jaar ervaring in het vak.
Op deze zwaardere versie zien de huidige scores er zo uit:
- Claude Opus 5.5: 61,8 procent van de beoordelingscriteria gehaald
- Fable 5.1: 61,0 procent
- GPT-6 Astra: 57,9 procent
Deze cijfers meten beoordelingscriteria, geen afgeronde taken. Volgens Mercor heeft geen enkel model bijna 60 procent van de taken in de benchmark volledig afgerond. Een model kan de meeste afzonderlijke stappen goed doen en een taak toch onaf laten.
Daarom concludeert Mercor dat AI de boeken nog niet zelfstandig kan afsluiten. Het afsluiten van de boeken is het proces aan het einde van een periode waarin een bedrijf zijn rekeningen voor een maand, kwartaal of jaar definitief maakt. Daarvoor moet elk onderdeel kloppen, niet het merendeel.
Wat het onderzoek niet testte
Mercor is open over de beperkingen van zijn eigen experiment. Volgens het bedrijf waren de taken bijna ideaal voor AI. Ze belonen twee dingen waar modellen heel goed in zijn: specifieke details opsporen en instructies letterlijk opvolgen.
Een aantal kernonderdelen van het werk van een accountant bleef volledig buiten beschouwing:
- Gesprekken met klanten
- Afstemming met collega's
- Oordeelsvermogen dat gebaseerd is op jarenlange kennis van een bedrijf
Mercor wijst op deze ontbrekende onderdelen als reden waarom accountants niet op het punt staan vervangen te worden. Tegelijk verwacht het bedrijf dat AI in de hele accountancysector voor flinke productiviteitswinst zal zorgen.
De cijfers goed lezen
Het onderzoek ondersteunt twee beweringen, en die zijn makkelijk door elkaar te halen.
De eerste is smal en sterk. Bij duidelijk afgebakende boekhoudtaken verslaan de huidige modellen gecertificeerde professionals op snelheid, nauwkeurigheid en kosten. De sprong van onder de 37 procent naar bijna perfect in 18 maanden is groot.
De tweede is breed en voorzichtig. Op een realistischere benchmark haalt het beste model maar ongeveer 62 procent van de beoordelingscriteria, en geen enkel model lost de meeste taken volledig op. Het werk dat overblijft, is juist het werk dat alles met elkaar verbindt.
Koppen die alleen de eerste bewering melden, overdrijven wat AI vandaag op een financiele afdeling kan. Koppen die alleen de tweede melden, missen hoe snel het gestructureerde deel van het vak is veranderd.
Het grotere plaatje
Voor teams die nadenken over AI in finance laat dit onderzoek een duidelijke tweedeling zien. Routinematig boekhoudwerk dat aan vaste regels gebonden is, lijkt klaar voor vergaande automatisering, waarbij mensen de uitkomsten controleren in plaats van ze zelf te maken. Processen van begin tot eind, zoals het afsluiten van de boeken, hebben nog steeds iemand nodig die de leiding heeft.
Dat past in een breder patroon. Modellen verslaan experts steeds vaker bij overzichtelijke, op zichzelf staande taken, terwijl volledige werkprocessen met veel afhankelijke stappen onbetrouwbaar blijven. Dezelfde spanning is zichtbaar in de opmars van AI-automatisering voor bedrijven, waarbij leveranciers beloven bedrijfsprocessen van begin tot eind af te handelen.
Het is ook goed om te kijken wie de test heeft uitgevoerd. Mercor heeft de benchmark gebouwd en het onderzoek gepubliceerd, dus onafhankelijke herhaling zou de resultaten meer gewicht geven.
Wat je de komende tijd in de gaten moet houden, is het verschil tussen de taken van het 37-procentniveau en de volledige benchmark. Als de volledige APEX-scores net zo snel stijgen als de vereenvoudigde, wordt het argument voor menselijk toezicht kleiner. Ook de kosten tellen mee, nu goedkopere modellen zoals GPT-6.1 Sol van OpenAI de prijs van dit werk verder omlaag duwen. Voorlopig wijst het bewijs erop dat accountants AI gaan begeleiden, niet dat ze erdoor vervangen worden.
