La IA supera a los contables, pero aún necesita supervisión

La IA supera a los contables, pero aún necesita supervisión

Los modelos de IA ya hacen el trabajo de contabilidad estructurada más rápido, con más precisión y a un coste mucho menor que los contables titulados. Es la principal conclusión de un nuevo estudio de Mercor. El mismo estudio muestra también que estos sistemas todavía no pueden completar un ciclo contable entero sin que una persona revise el trabajo.

Los dos hallazgos apuntan en direcciones distintas, y ambos importan. A continuación, qué midió el estudio, qué dejó fuera y por qué la distancia entre ambos resultados es la verdadera noticia.

El cara a cara

Mercor reclutó a 12 CPA colegiados. CPA son las siglas de certified public accountant, la principal acreditación profesional de contabilidad en Estados Unidos. De media, los participantes tenían cinco años y medio de experiencia. Trabajaron con tareas simplificadas extraídas del APEX Accounting Benchmark, el conjunto de pruebas de Mercor para trabajo contable.

La media humana en estas tareas fue de alrededor del 37 por ciento. Hace dieciocho meses, incluso los modelos de IA más potentes se quedaban por debajo de esa marca. Hoy, según Mercor, los mejores modelos resuelven ese mismo conjunto de tareas casi sin errores.

En ese periodo, las máquinas han pasado de ir por detrás de los profesionales en activo a superarlos con claridad en esta parcela concreta del oficio. Mercor señala que los modelos fueron además más rápidos y mucho más baratos por tarea.

La prueba completa cuenta otra historia

Las tareas simplificadas son solo una pequeña parte de APEX Accounting. La prueba completa incluye 160 tareas repartidas entre 10 empresas simuladas. La elaboraron más de 40 profesionales, con una media de 11 años de experiencia en el sector.

En esta versión más exigente, las puntuaciones actuales son estas:

  • Claude Opus 5.5: 61,8 por ciento de los criterios de evaluación cumplidos
  • Fable 5.1: 61,0 por ciento
  • GPT-6 Astra: 57,9 por ciento

Estas cifras miden criterios de evaluación, no tareas terminadas. Mercor afirma que ningún modelo completó del todo casi el 60 por ciento de las tareas de la prueba. Un modelo puede acertar en la mayoría de los pasos individuales y aun así dejar una tarea a medias.

Por eso Mercor concluye que la IA todavía no puede hacer el cierre contable por sí sola. El cierre contable es el proceso de final de periodo en el que una empresa da por definitivas sus cuentas de un mes, un trimestre o un año. Exige que todas las piezas estén bien, no la mayoría.

Lo que el estudio no puso a prueba

Mercor reconoce abiertamente los límites de su propio experimento. La empresa admite que las tareas eran casi ideales para la IA. Premian dos cosas en las que los modelos son muy buenos: localizar detalles concretos y seguir instrucciones al pie de la letra.

Varias partes esenciales del trabajo de un contable se quedaron completamente fuera:

  • Las conversaciones con clientes
  • La coordinación con compañeros
  • El criterio que da conocer un negocio durante años

Mercor señala estas carencias como el motivo por el que los contables no van a ser sustituidos a corto plazo. Al mismo tiempo, prevé que la IA traiga grandes mejoras de productividad en todo el sector contable.

Leer las cifras con cuidado

El estudio respalda dos afirmaciones, y es fácil confundirlas.

La primera es acotada y contundente. En tareas contables bien definidas, los modelos actuales superan a profesionales colegiados en rapidez, precisión y coste. El salto de menos del 37 por ciento a casi la perfección en 18 meses es enorme.

La segunda es amplia y prudente. En una prueba más realista, el mejor modelo cumple solo alrededor del 62 por ciento de los criterios de evaluación, y ningún modelo resuelve por completo la mayoría de las tareas. El trabajo que queda pendiente es precisamente el que lo une todo.

Los titulares que solo recogen la primera afirmación exageran lo que la IA puede hacer hoy en un departamento de contabilidad. Los que solo recogen la segunda pasan por alto lo rápido que ha cambiado la parte estructurada del trabajo.

El contexto general

Para los equipos que se plantean usar IA en finanzas, este estudio sugiere una división clara. La contabilidad rutinaria y sujeta a normas parece lista para una automatización intensiva, con personas que revisan los resultados en lugar de producirlos. Los procesos de principio a fin, como el cierre contable, siguen necesitando a alguien al mando.

Esto encaja con una tendencia más amplia. Los modelos superan cada vez más a los expertos en tareas limpias y aisladas, mientras que los flujos de trabajo completos, con muchos pasos que dependen unos de otros, siguen sin ser fiables. La misma tensión aparece en todo el impulso hacia la automatización empresarial con IA, donde los proveedores prometen gestionar los procesos de negocio de principio a fin.

También conviene fijarse en quién hizo la prueba. Mercor creó la prueba y publicó el estudio, así que una replicación independiente daría más peso a sus resultados.

Lo que hay que vigilar ahora es la distancia entre las tareas del tipo de las del 37 por ciento y la prueba completa. Si las puntuaciones de APEX completo suben tan rápido como lo hicieron las de las tareas simplificadas, el margen para la supervisión humana se irá estrechando. El coste también contará, ya que modelos más baratos como GPT-6.1 Sol de OpenAI abaratan todavía más este trabajo. Por ahora, las pruebas apuntan a contables que supervisan a la IA, no a contables sustituidos por ella.