L'IA bat les CPA en comptabilité, mais reste à superviser
Les modèles d'IA traitent désormais les tâches de tenue de comptes structurées plus vite, avec plus de précision et pour bien moins cher que des comptables qualifiés. C'est le principal résultat d'une nouvelle étude de Mercor. Cette même étude montre aussi que ces systèmes ne savent toujours pas boucler un cycle comptable complet sans qu'un humain vérifie le travail.
Les deux constats vont dans des directions opposées, et tous deux comptent. Voici ce que l'étude a mesuré, ce qu'elle a laissé de côté, et pourquoi l'écart entre les deux est le vrai sujet.
Le duel
Mercor a recruté 12 CPA. CPA signifie certified public accountant, le principal titre professionnel de la comptabilité aux États-Unis. Les participants avaient en moyenne cinq ans et demi d'expérience. Ils ont traité des tâches simplifiées tirées de l'APEX Accounting Benchmark, la batterie de tests de Mercor consacrée au travail comptable.
La moyenne humaine sur ces tâches tournait autour de 37 %. Il y a dix-huit mois, même les meilleurs modèles d'IA restaient sous cette barre. Aujourd'hui, selon Mercor, les meilleurs modèles résolvent ce même ensemble de tâches presque sans erreur.
En l'espace de cette période, les machines sont passées de la traîne derrière des professionnels en exercice à une nette supériorité sur ce segment étroit du métier. Mercor indique que les modèles étaient aussi plus rapides et coûtaient beaucoup moins cher par tâche.
Le benchmark complet raconte une autre histoire
Les tâches simplifiées ne représentent qu'une petite partie d'APEX Accounting. Le benchmark complet comprend 160 tâches réparties sur 10 entreprises simulées. Plus de 40 professionnels l'ont conçu, avec en moyenne 11 ans d'expérience dans le domaine.
Sur cette version plus difficile, les scores actuels sont les suivants :
- Claude Opus 5.5 : 61,8 % des critères d'évaluation remplis
- Fable 5.1 : 61,0 %
- GPT-6 Astra : 57,9 %
Ces chiffres mesurent des critères d'évaluation, pas des tâches terminées. Selon Mercor, aucun modèle n'a entièrement mené à bien près de 60 % des tâches du benchmark. Un modèle peut réussir la plupart des étapes prises une à une et laisser malgré tout une tâche inachevée.
C'est pourquoi Mercor conclut que l'IA ne peut pas encore clôturer les comptes seule. La clôture des comptes est le processus de fin de période au cours duquel une entreprise arrête ses comptes pour un mois, un trimestre ou un exercice. Elle exige que chaque élément soit juste, pas la plupart d'entre eux.
Ce que l'étude n'a pas testé
Mercor ne cache pas les limites de sa propre expérience. L'entreprise reconnaît que les tâches étaient quasi idéales pour l'IA. Elles récompensent deux choses dans lesquelles les modèles excellent : retrouver des détails précis et suivre des consignes à la lettre.
Plusieurs volets essentiels du métier de comptable ont été entièrement laissés de côté :
- Les échanges avec les clients
- La coordination avec les collègues
- Le jugement forgé par des années de connaissance d'une entreprise
Mercor voit dans ces éléments manquants la raison pour laquelle les comptables ne sont pas près d'être remplacés. Dans le même temps, elle s'attend à ce que l'IA apporte d'importants gains de productivité dans tout le secteur comptable.
Lire les chiffres avec prudence
L'étude étaye deux affirmations, et il est facile de les confondre.
La première est étroite et solide. Sur des tâches de tenue de comptes bien définies, les modèles actuels battent des professionnels diplômés en vitesse, en précision et en coût. Le bond de moins de 37 % à un score quasi parfait en 18 mois est considérable.
La seconde est large et prudente. Sur un benchmark plus réaliste, le meilleur modèle ne remplit qu'environ 62 % des critères d'évaluation, et aucun modèle ne résout entièrement la plupart des tâches. Le travail qui reste, c'est celui qui fait tenir l'ensemble.
Les titres qui ne retiennent que la première affirmation surestiment ce que l'IA peut faire aujourd'hui dans un service comptable. Ceux qui ne retiennent que la seconde passent à côté de la vitesse à laquelle la partie structurée du métier a changé.
Vue d'ensemble
Pour les équipes qui réfléchissent à l'IA dans la finance, cette étude dessine une ligne de partage claire. La tenue de comptes routinière et encadrée par des règles semble mûre pour une automatisation poussée, les humains vérifiant les résultats au lieu de les produire. Les processus de bout en bout comme la clôture des comptes ont encore besoin d'une personne aux commandes.
Cela s'inscrit dans une tendance plus large. Les modèles battent de plus en plus souvent les experts sur des tâches nettes et isolées, tandis que les flux de travail complets, faits de nombreuses étapes interdépendantes, restent peu fiables. On retrouve la même tension dans l'essor de l'automatisation par l'IA en entreprise, où les éditeurs promettent une prise en charge de bout en bout des processus métier.
Il faut aussi noter qui a mené le test. Mercor a conçu le benchmark et publié l'étude : une reproduction indépendante donnerait plus de poids à ses résultats.
À surveiller désormais : l'écart entre les tâches du type "37 %" et le benchmark complet. Si les scores sur l'APEX complet grimpent aussi vite que ceux des tâches simplifiées, les arguments en faveur d'une supervision humaine perdront du terrain. Le coût comptera aussi, à mesure que des modèles moins chers comme GPT-6.1 Sol d'OpenAI font encore baisser le prix de ce travail. Pour l'instant, les éléments disponibles indiquent que les comptables vont superviser l'IA, pas être remplacés par elle.
