Tester Luca

← Retour aux évaluations

OpenAI GPT-4.1

Ancien moteur d’évaluation web converti au format verifier. Ancienne configuration serveur base, supposée GPT-4.1.
Raisonnement : medium · Juge : GPT‑5.5

En un coup d’œil

OpenAI GPT-4.1 obtient un score moyen de 42.7/100.

Il produit une erreur technique grave sur 16 question(s) sur 50.

40 question(s) sur 50 ont obtenu au moins un peu de points, 10 sont des échecs complets (score nul).

Ses meilleures performances sont sur le thème comptabilité (48.6/100), ses plus faibles sur fiscalité (21.2/100).

Indicateurs clés

Score moyen
42.7/100
Moyenne sur 50 question(s). Chaque question est notée de 0 à 10, ramenée ici sur 100.
Réponses non nulles
80.0%
40 question(s) sur 50 ont obtenu au moins un peu de points.
Erreurs majeures
32.0%
16 question(s) sur 50 contiennent une erreur technique grave.
Questions
50
Nombre de questions posées au modèle.
Temps moyen par réponse
s
Durée moyenne de génération de chaque réponse par le modèle.
Longueur moyenne de réponse
mots
Longueur moyenne des réponses produites, en mots.

Avec Luca et LLM utilisé seul (sans environnement Luca)

Avec Luca, le modèle gagne 7.7 points sur le score moyen.

Avec Luca, le taux d’erreurs majeures est plus élevé de 2.0 points.

Score moyen
Avec Luca42.7/100
LLM seul35.0/100
+7.7 pts grâce à Luca
Erreurs majeures
Avec Luca32.0%
LLM seul30.0%
−2.0 pts perdus avec Luca
Réponses non nulles
Avec Luca80.0%
LLM seul76.0%
+4.0 pts grâce à Luca

Classement par thème

Meilleur thème comptabilité (48.6/100) · Plus faible fiscalité (21.2/100)

Score moyen par thème

Avec LucaLLM seulcomptabilitécomptabilité48.6%43.4%droit des sociétésdroit des sociétés36.4%20.7%social/payesocial/paye23.3%29.3%fiscalitéfiscalité21.2%0.0%

Échecs complets vs réponses utiles

Sur 50 question(s), 10 ont reçu un score nul (échec complet), " 40 ont obtenu au moins un peu de points.

20.0 nul
80.0 non nul
Détails de la distribution des scores

Répartition des notes attribuées par le juge (de 0 à 10). Permet de voir si le modèle obtient beaucoup de notes moyennes, ou si tout se joue aux extrêmes (succès complets vs échecs francs).

Distribution des scores (sur 10)

0.0-1.0101.0-2.022.0-3.0103.0-4.024.0-5.055.0-6.036.0-7.027.0-8.078.0-9.059.0-10.04