Tester Luca

Quelle IA répond le mieux aux questions comptables et fiscales ?

Luca, assistant comptable virtuel

Nous testons régulièrement les principaux LLM sur des questions comptables et fiscales réelles afin de mesurer leur fiabilité et leur pertinence.

Pourquoi ce benchmark ?

Les IA généralistes progressent rapidement mais leurs performances restent très variables en comptabilité.

Nous comparons régulièrement les principaux modèles afin de mesurer leurs performances sur des questions comptables réelles et dans des conditions identiques.

Comment interpréter les résultats ?

Score moyen
Qualité moyenne des réponses obtenues sur l’ensemble des questions.
LLM utilisé seul (sans environnement Luca)
Même modèle interrogé directement, sans l’environnement Luca.
Erreurs majeures
Réponses comportant une erreur technique ou réglementaire importante.

Pourquoi Luca obtient-il de meilleurs résultats ?

Luca est une IA générative sécurisée conçue pour les professionnels du chiffre. Enrichie par un corpus de sources comptables, fiscales et sociales officielles, elle renforce les principaux LLM du marché afin d’améliorer la fiabilité et la traçabilité des réponses.

Luca ne se contente pas d’interroger un LLM :

  • Il sélectionne automatiquement le modèle le plus adapté ;
  • Il enrichit les réponses avec des sources comptables et fiscales fiables ;
  • Il applique des traitements spécialisés ;
  • Il garantit la confidentialité des données grâce à une infrastructure sécurisée en France.

Chiffres clés

Impact moyen avec Luca, par rapport au LLM utilisé seul.

+10,0 pts
de score moyen
−7,4 pts
d’erreurs majeures
10
LLM testés
150
questions comptables
Résultats du benchmark

Scores moyens par modèle (sur 100)

Plus le score est élevé, meilleure est la performance. « LLM seul » désigne le modèle utilisé sans l’environnement Luca.

En moyenne, Luca améliore le score de 10,0 pts / 100 et réduit les erreurs majeures de 7,4 points.

Avec LucaLLM seulAnthropic Claude Opus 5Anthropic Claude Opus 5Avec Luca72.1%+6.1 ptsLLM seul66.0%OpenAI GPT-5.6 SolOpenAI GPT-5.6 SolAvec Luca66.3%+7.4 ptsLLM seul58.9%OpenAI GPT-5.6 LunaOpenAI GPT-5.6 LunaAvec Luca65.9%+12.1 ptsLLM seul53.8%Anthropic Claude Opus 4.8Anthropic Claude Opus 4.8Avec Luca61.7%+11.7 ptsLLM seul50.0%OpenAI GPT-5.6 TerraOpenAI GPT-5.6 TerraAvec Luca61.5%+6.7 ptsLLM seul54.8%OpenAI GPT-5.4OpenAI GPT-5.4Avec Luca59.6%+12.5 ptsLLM seul47.1%DeepSeek V4 FlashDeepSeek V4 FlashAvec Luca55.6%+16.7 ptsLLM seul38.9%Google Gemini 3.5 FlashGoogle Gemini 3.5 FlashAvec Luca50.0%+2.1 ptsLLM seul47.9%Mistral Large 3Mistral Large 3Avec Luca46.0%+16.6 ptsLLM seul29.4%OpenAI GPT-4.1OpenAI GPT-4.1Avec Luca42.7%+7.7 ptsLLM seul35.0%

Sur l’ensemble des modèles testés, Luca améliore systématiquement la qualité des réponses tout en réduisant les erreurs les plus critiques.

Résultats détaillés du benchmark

Pour chaque modèle, comparaison du score moyen et du taux d’erreurs majeures avec et sans l’environnement Luca.

#ÉvaluationQuestions Score moyenPlus = mieux Erreurs majeuresMoins = mieux
Avec LucaLLM utilisé seul
(sans environnement Luca)
Avec LucaLLM utilisé seul
(sans environnement Luca)
1 Anthropic Claude Opus 5
Raisonnement : medium · Juge : GPT‑5.5
150
72.1
66.0−6.1 pts
17.6
23.6+6.0 pts
2 OpenAI GPT-5.6 Sol
Raisonnement : medium · Juge : GPT‑5.5
150
66.3
58.9−7.4 pts
19.6
20.7+1.1 pts
3 OpenAI GPT-5.6 Luna
Raisonnement : medium · Juge : GPT‑5.5
150
65.9
53.8−12.1 pts
16.4
24.4+8.0 pts
4 Anthropic Claude Opus 4.8
Raisonnement : medium · Juge : GPT‑5.5
150
61.7
50.0−11.7 pts
24.7
27.3+2.7 pts
5 OpenAI GPT-5.6 Terra
Raisonnement : medium · Juge : GPT‑5.5
150
61.5
54.8−6.7 pts
19.8
26.2+6.4 pts
6 OpenAI GPT-5.4
Raisonnement : medium · Juge : GPT‑5.5
150
59.6
47.1−12.5 pts
18.2
24.9+6.7 pts
7 DeepSeek V4 Flash
Raisonnement : medium · Juge : GPT‑5.5
100
55.6
38.9−16.7 pts
31.0
37.2+6.2 pts
8 Google Gemini 3.5 Flash
Raisonnement : medium · Juge : GPT‑5.5
150
50.0
47.9−2.1 pts
18.7
37.6+18.9 pts
9 Mistral Large 3
Raisonnement : medium · Juge : GPT‑5.5
150
46.0
29.4−16.6 pts
34.9
54.7+19.8 pts
10 OpenAI GPT-4.1
Raisonnement : medium · Juge : GPT‑5.5
50
42.7
35.0−7.7 pts
32.0
30.0−2.0 pts

Note méthodologique

Les résultats sont obtenus à partir d’un jeu de questions comptables élaboré par ComptaSecure. Les modèles sont testés dans des conditions identiques afin de garantir une comparaison équitable.