KI schlägt CPAs bei Buchhaltung, braucht aber Kontrolle
KI-Modelle erledigen strukturierte Buchhaltungsaufgaben inzwischen schneller, genauer und deutlich günstiger als ausgebildete Buchhalter. Das ist das zentrale Ergebnis einer neuen Studie von Mercor. Dieselbe Studie zeigt aber auch, dass diese Systeme einen vollständigen Buchhaltungszyklus noch immer nicht abschließen können, ohne dass ein Mensch die Arbeit prüft.
Die beiden Befunde weisen in unterschiedliche Richtungen, und beide sind wichtig. Im Folgenden geht es darum, was die Studie gemessen hat, was sie ausgeklammert hat und warum gerade die Lücke zwischen beidem die eigentliche Geschichte ist.
Der direkte Vergleich
Mercor hat 12 zugelassene CPAs rekrutiert. CPA steht für Certified Public Accountant, die wichtigste berufliche Qualifikation im Rechnungswesen in den USA. Im Schnitt brachten die Teilnehmer fünfeinhalb Jahre Berufserfahrung mit. Sie bearbeiteten vereinfachte Aufgaben aus dem APEX Accounting Benchmark, Mercors Testreihe für Buchhaltungsarbeit.
Der menschliche Durchschnitt lag bei diesen Aufgaben bei etwa 37 Prozent. Vor achtzehn Monaten lagen selbst die stärksten KI-Modelle noch unter dieser Marke. Heute lösen die besten Modelle laut Mercor dieselben Aufgaben nahezu fehlerfrei.
In diesem Zeitraum haben die Maschinen also aufgeholt: Erst lagen sie hinter erfahrenen Fachleuten, nun übertreffen sie diese in diesem schmalen Ausschnitt der Arbeit deutlich. Mercor zufolge waren die Modelle zudem schneller und kosteten pro Aufgabe wesentlich weniger.
Der vollständige Benchmark zeigt ein anderes Bild
Die vereinfachten Aufgaben machen nur einen kleinen Teil von APEX Accounting aus. Der vollständige Benchmark umfasst 160 Aufgaben, verteilt auf 10 simulierte Unternehmen. Entwickelt haben ihn mehr als 40 Fachleute mit durchschnittlich 11 Jahren Berufserfahrung.
In dieser schwierigeren Version sehen die aktuellen Ergebnisse so aus:
- Claude Opus 5.5: 61,8 Prozent der Bewertungskriterien erfüllt
- Fable 5.1: 61,0 Prozent
- GPT-6 Astra: 57,9 Prozent
Diese Zahlen messen Bewertungskriterien, nicht abgeschlossene Aufgaben. Laut Mercor hat kein Modell knapp 60 Prozent der Aufgaben im Benchmark vollständig gelöst. Ein Modell kann die meisten Einzelschritte richtig machen und eine Aufgabe trotzdem unvollendet lassen.
Deshalb kommt Mercor zu dem Schluss, dass KI den Abschluss noch nicht allein erstellen kann. Der Abschluss ist der Prozess am Ende einer Periode, in dem ein Unternehmen seine Bücher für einen Monat, ein Quartal oder ein Jahr finalisiert. Dafür muss jedes einzelne Teil stimmen, nicht nur die meisten.
Was die Studie nicht getestet hat
Mercor geht offen mit den Grenzen des eigenen Experiments um. Nach Angaben des Unternehmens waren die Aufgaben nahezu ideal für KI. Sie belohnen zwei Dinge, die Modelle besonders gut können: bestimmte Details aufspüren und Anweisungen haargenau befolgen.
Mehrere Kernbereiche der Arbeit eines Buchhalters blieben komplett außen vor:
- Gespräche mit Mandanten
- Abstimmung mit Kollegen
- Urteilsvermögen, das auf jahrelangem Wissen über ein Unternehmen beruht
Mercor nennt genau diese fehlenden Teile als Grund dafür, dass Buchhalter nicht so bald ersetzt werden. Gleichzeitig rechnet das Unternehmen damit, dass KI der gesamten Branche große Produktivitätsgewinne bringen wird.
Die Zahlen genau lesen
Die Studie stützt zwei Aussagen, und man verwechselt sie leicht.
Die erste ist eng gefasst und belastbar. Bei klar definierten Buchhaltungsaufgaben schlagen aktuelle Modelle zugelassene Fachleute bei Tempo, Genauigkeit und Kosten. Der Sprung von unter 37 Prozent auf nahezu perfekt in 18 Monaten ist gewaltig.
Die zweite ist breit angelegt und vorsichtig. In einem realistischeren Benchmark erfüllt das beste Modell nur etwa 62 Prozent der Bewertungskriterien, und kein Modell löst die Mehrheit der Aufgaben vollständig. Was übrig bleibt, ist genau die Arbeit, die alles zusammenführt.
Schlagzeilen, die nur die erste Aussage aufgreifen, übertreiben, was KI heute in einer Buchhaltungsabteilung leisten kann. Schlagzeilen, die nur die zweite aufgreifen, übersehen, wie schnell sich der strukturierte Teil der Arbeit verändert hat.
Das große Ganze
Für Teams, die über KI im Finanzbereich nachdenken, legt die Studie eine klare Aufteilung nahe. Routinemäßige, regelgebundene Buchhaltung scheint reif für weitgehende Automatisierung, wobei Menschen die Ergebnisse prüfen, statt sie selbst zu erstellen. Durchgängige Prozesse wie der Abschluss brauchen weiterhin einen Menschen, der die Verantwortung trägt.
Das passt zu einem größeren Muster. Modelle schlagen Experten immer häufiger bei sauberen, isolierten Aufgaben, während vollständige Arbeitsabläufe mit vielen voneinander abhängigen Schritten unzuverlässig bleiben. Dieselbe Spannung zeigt sich beim Vorstoß in die KI-Automatisierung für Unternehmen, bei dem Anbieter versprechen, Geschäftsprozesse von Anfang bis Ende abzuwickeln.
Bemerkenswert ist auch, wer den Test durchgeführt hat. Mercor hat den Benchmark entwickelt und die Studie veröffentlicht, eine unabhängige Wiederholung würde den Ergebnissen also mehr Gewicht verleihen.
Spannend wird als Nächstes die Lücke zwischen den Aufgaben vom Typ "37 Prozent" und dem vollständigen Benchmark. Steigen die Ergebnisse im vollen APEX-Test so schnell wie bei den vereinfachten Aufgaben, wird das Argument für menschliche Aufsicht schwächer. Auch die Kosten spielen eine Rolle, denn günstigere Modelle wie OpenAIs GPT-6.1 Sol drücken den Preis dieser Arbeit weiter. Vorerst deutet alles darauf hin, dass Buchhalter die KI beaufsichtigen, statt von ihr ersetzt zu werden.
