Tester Luca

← Retour aux évaluations

OpenAI GPT-5.6 Luna

Exécutions GPT-5.6 Luna avec et sans LUCA sur 150 questions avec 3 générations par question.
Raisonnement : medium · Juge : GPT‑5.5

En un coup d’œil

OpenAI GPT-5.6 Luna obtient un score moyen de 65.9/100.

Il produit une erreur technique grave sur 74 question(s) sur 450.

420 question(s) sur 450 ont obtenu au moins un peu de points, 30 sont des échecs complets (score nul).

Ses meilleures performances sont sur le thème conformité (83.0/100), ses plus faibles sur droit des sociétés (55.7/100).

Indicateurs clés

Score moyen
65.9/100
Moyenne sur 150 question(s). Chaque question est notée de 0 à 10, ramenée ici sur 100.
Réponses non nulles
93.3%
140 question(s) sur 150 ont obtenu au moins un peu de points.
Erreurs majeures
16.4%
25 question(s) sur 150 contiennent une erreur technique grave.
Questions
150
Nombre de questions posées au modèle.
Temps moyen par réponse
35.1 s
Le modèle met ~35.1 s en moyenne pour produire une réponse.
Longueur moyenne de réponse
637 mots
~637 mots en moyenne par réponse sur 150 question(s).

Avec Luca et LLM utilisé seul (sans environnement Luca)

Avec Luca, le modèle gagne 12.1 points sur le score moyen.

Avec Luca, le taux d’erreurs majeures est réduit de 8.0 points.

Score moyen
Avec Luca65.9/100
LLM seul53.8/100
+12.1 pts grâce à Luca
Erreurs majeures
Avec Luca16.4%
LLM seul24.4%
+8.0 pts grâce à Luca
Réponses non nulles
Avec Luca93.3%
LLM seul88.2%
+5.1 pts grâce à Luca

Classement par thème

Meilleur thème conformité (83.0/100) · Plus faible droit des sociétés (55.7/100)

Score moyen par thème

Avec LucaLLM seulconformitéconformité83.0%82.2%comptabilitécomptabilité70.3%65.0%fiscalitéfiscalité67.2%51.3%social/payesocial/paye62.2%45.5%droit des sociétésdroit des sociétés55.7%46.4%

Échecs complets vs réponses utiles

Sur 450 question(s), 30 ont reçu un score nul (échec complet), " 420 ont obtenu au moins un peu de points.

6.7 nul
93.3 non nul
Détails de la distribution des scores

Répartition des notes attribuées par le juge (de 0 à 10). Permet de voir si le modèle obtient beaucoup de notes moyennes, ou si tout se joue aux extrêmes (succès complets vs échecs francs).

Pass@k

@1@174.0%@2@281.6%

Distribution des scores (sur 10)

0.0-1.0351.0-2.072.0-3.0113.0-4.0234.0-5.0415.0-6.0246.0-7.0397.0-8.0808.0-9.0899.0-10.0101