Quelle IA répond le mieux aux questions comptables et fiscales ?
Nous testons régulièrement les principaux LLM sur des questions comptables et fiscales réelles afin de mesurer leur fiabilité et leur pertinence.
Pourquoi ce benchmark ?
Les IA généralistes progressent rapidement mais leurs performances restent très variables en comptabilité.
Nous comparons régulièrement les principaux modèles afin de mesurer leurs performances sur des questions comptables réelles et dans des conditions identiques.
Comment interpréter les résultats ?
- Score moyen
- Qualité moyenne des réponses obtenues sur l’ensemble des questions.
- LLM utilisé seul (sans environnement Luca)
- Même modèle interrogé directement, sans l’environnement Luca.
- Erreurs majeures
- Réponses comportant une erreur technique ou réglementaire importante.
Pourquoi Luca obtient-il de meilleurs résultats ?
Luca est une IA générative sécurisée conçue pour les professionnels du chiffre. Enrichie par un corpus de sources comptables, fiscales et sociales officielles, elle renforce les principaux LLM du marché afin d’améliorer la fiabilité et la traçabilité des réponses.
Luca ne se contente pas d’interroger un LLM :
- Il sélectionne automatiquement le modèle le plus adapté ;
- Il enrichit les réponses avec des sources comptables et fiscales fiables ;
- Il applique des traitements spécialisés ;
- Il garantit la confidentialité des données grâce à une infrastructure sécurisée en France.
Chiffres clés
Impact moyen avec Luca, par rapport au LLM utilisé seul.
Scores moyens par modèle (sur 100)
Plus le score est élevé, meilleure est la performance. « LLM seul » désigne le modèle utilisé sans l’environnement Luca.
En moyenne, Luca améliore le score de 10,0 pts / 100 et réduit les erreurs majeures de 7,4 points.
Sur l’ensemble des modèles testés, Luca améliore systématiquement la qualité des réponses tout en réduisant les erreurs les plus critiques.
Résultats détaillés du benchmark
Pour chaque modèle, comparaison du score moyen et du taux d’erreurs majeures avec et sans l’environnement Luca.
| # | Évaluation | Questions | Score moyenPlus = mieux | Erreurs majeuresMoins = mieux | ||
|---|---|---|---|---|---|---|
| Avec Luca | LLM utilisé seul (sans environnement Luca) |
Avec Luca | LLM utilisé seul (sans environnement Luca) |
|||
| 1 | Anthropic Claude Opus 5 Raisonnement : medium · Juge : GPT‑5.5 |
150 | 72.1 |
66.0−6.1 pts |
17.6 |
23.6+6.0 pts |
| 2 | OpenAI GPT-5.6 Sol Raisonnement : medium · Juge : GPT‑5.5 |
150 | 66.3 |
58.9−7.4 pts |
19.6 |
20.7+1.1 pts |
| 3 | OpenAI GPT-5.6 Luna Raisonnement : medium · Juge : GPT‑5.5 |
150 | 65.9 |
53.8−12.1 pts |
16.4 |
24.4+8.0 pts |
| 4 | Anthropic Claude Opus 4.8 Raisonnement : medium · Juge : GPT‑5.5 |
150 | 61.7 |
50.0−11.7 pts |
24.7 |
27.3+2.7 pts |
| 5 | OpenAI GPT-5.6 Terra Raisonnement : medium · Juge : GPT‑5.5 |
150 | 61.5 |
54.8−6.7 pts |
19.8 |
26.2+6.4 pts |
| 6 | OpenAI GPT-5.4 Raisonnement : medium · Juge : GPT‑5.5 |
150 | 59.6 |
47.1−12.5 pts |
18.2 |
24.9+6.7 pts |
| 7 | DeepSeek V4 Flash Raisonnement : medium · Juge : GPT‑5.5 |
100 | 55.6 |
38.9−16.7 pts |
31.0 |
37.2+6.2 pts |
| 8 | Google Gemini 3.5 Flash Raisonnement : medium · Juge : GPT‑5.5 |
150 | 50.0 |
47.9−2.1 pts |
18.7 |
37.6+18.9 pts |
| 9 | Mistral Large 3 Raisonnement : medium · Juge : GPT‑5.5 |
150 | 46.0 |
29.4−16.6 pts |
34.9 |
54.7+19.8 pts |
| 10 | OpenAI GPT-4.1 Raisonnement : medium · Juge : GPT‑5.5 |
50 | 42.7 |
35.0−7.7 pts |
32.0 |
30.0−2.0 pts |
Note méthodologique
Les résultats sont obtenus à partir d’un jeu de questions comptables élaboré par ComptaSecure. Les modèles sont testés dans des conditions identiques afin de garantir une comparaison équitable.
Analyse des données comptables
Analyse comptable à partir d’un FEC
Nous évaluons la capacité des principaux LLM à analyser un fichier des écritures comptables et à produire des conclusions exactes, complètes et vérifiables.
Les mêmes questions sont traitées avec Luca et par le LLM utilisé seul à partir du ou des FEC fournis.
Contrairement à un LLM généraliste, Luca n’impose aucune limite au nombre de lignes du FEC transmis : grâce à ses outils spécialisés, il analyse l’intégralité des écritures sans sacrifier la profondeur ni la fiabilité de l’analyse.
Pourquoi Luca obtient-il de meilleurs résultats ?
Luca est une IA générative sécurisée conçue pour les professionnels du chiffre. Enrichie par un corpus de sources comptables, fiscales et sociales officielles, elle renforce les principaux LLM du marché afin d’améliorer la fiabilité et la traçabilité des réponses.
Luca ne se contente pas d’interroger un LLM :
- Il sélectionne automatiquement le modèle le plus adapté ;
- Il combine son analyse avec des méthodes d’analyse déterministes propres à ComptaSecure ;
- Il applique des traitements spécialisés ;
- Il garantit la confidentialité des données grâce à une infrastructure sécurisée en France.
Comment interpréter les résultats ?
- Score moyen
- Qualité globale de l’analyse, évaluée à partir d’une grille détaillée sur 10 points puis ramenée sur 100.
- Faits attendus manquants
- Nombre total d’informations attendues absentes des réponses. Moins = mieux.
- Erreurs numériques
- Nombre total d’écarts sur les valeurs numériques explicitement évaluées par la grille. Les chiffres annexes sans impact sur la notation sont exclus. Moins = mieux.
Chiffres clés
Impact moyen avec Luca, par rapport au LLM utilisé seul.
Erreurs numériques sur l’ensemble des modèles : −32 avec Luca.
Scores moyens d’analyse FEC (sur 100)
Plus le score est élevé, meilleure est l’analyse. Les résultats sont recalculés sur un périmètre strictement identique.
En moyenne, Luca améliore le score d’analyse FEC de +37,8 pts.
Sur les 6 modèles comparables, Luca améliore le score moyen de +37,8 pts et réduit le nombre de faits attendus manquants ainsi que les erreurs numériques.
Résultats détaillés du benchmark FEC
| Modèle | Score moyenPlus = mieux | Faits manquantsMoins = mieux | Erreurs numériquesMoins = mieux | ||||
|---|---|---|---|---|---|---|---|
| Avec Luca | LLM seul | Gain | Avec Luca | LLM seul | Avec Luca | LLM seul | |
| OpenAI GPT-5.6 Sol | 95,0 | 58,8 | +36,2 pts | 24 | 98 | 0 | 12 |
| OpenAI GPT-5.6 Terra | 93,3 | 53,3 | +40,0 pts | 21 | 102 | 0 | 5 |
| Anthropic Claude Opus 5 | 91,2 | 64,3 | +26,8 pts | 43 | 82 | 17 | 17 |
| OpenAI GPT-5.6 Luna | 90,2 | 48,5 | +41,7 pts | 24 | 104 | 0 | 13 |
| OpenAI GPT-5.4 | 89,8 | 43,3 | +46,5 pts | 27 | 102 | 10 | 10 |
| Anthropic Claude Opus 4.8 | 74,1 | 38,5 | +35,6 pts | 78 | 123 | 19 | 21 |
| Mistral Large 3 | 68,2 | — | — | 76 | — | 22 | — |
Questions couvertes
Note méthodologique
Les résultats portent sur 10 questions d’analyse de FEC, avec 3 générations par question. Avec Luca, le modèle utilise l’environnement spécialisé d’analyse comptable. Le LLM utilisé seul reçoit le ou les FEC nécessaires et la question correspondante. Les réponses sont évaluées par un juge commun à partir d’une grille détaillée sur 10 points.