sur les coûts d’usage de l’IA dans certaines configurations, grâce à l’orchestration des modèles.
Note de recherche
Qualité du travail et coûts d’usage : premiers résultats de nos tests
Une étude menée sur des tâches d’analyse et de production documentaire pour mesurer l’effet de la structuration du raisonnement et de l’orchestration des modèles sur la qualité du travail et les coûts d’usage.
Les principaux résultats
des comparaisons montrent une amélioration de la qualité liée à la structuration du raisonnement.
Benchmark interne sur 66 comparaisons anonymisées. Méthode, périmètre et limites présentés dans l’étude complète.
Ce que nous avons étudié
Nous avons mené deux analyses complémentaires pour évaluer l’effet de l’orchestration Spotwork.AI :
- un benchmark portant sur la qualité de travaux d’analyse et de production documentaire ;
- une analyse des coûts d’usage des modèles à partir d’appels réalisés en production.
Les résultats sur la qualité et les coûts proviennent de deux analyses distinctes. Ils permettent d’examiner deux dimensions d’un même objectif : produire un travail de qualité en mobilisant les capacités d’IA de manière plus efficiente.
Résultats sur la qualité
Une meilleure qualité avec un raisonnement structuré.
Le benchmark compare l’orchestration Spotwork.AI au raisonnement natif d’un même modèle. Les deux configurations ont été évaluées sur les mêmes tâches et selon les mêmes critères.
Sur 66 comparaisons anonymisées, les réponses produites avec Spotwork.AI obtiennent une note moyenne de 8,1 sur 10, contre 7,4 sur 10 pour le raisonnement natif du modèle.
65 % des comparaisons montrent une amélioration de la qualité liée à la structuration du raisonnement.
Les améliorations les plus marquées
Des recommandations plus directement exploitables et mieux reliées au travail à accomplir.
Des réponses plus claires, mieux organisées et plus faciles à examiner.
Une meilleure distinction entre les éléments établis, les hypothèses et les points à confirmer.
Résultats sur les coûts
Réduire le coût des modèles grâce à l’orchestration.
L’analyse des coûts repose sur environ 7 200 appels de production réalisés pendant 14 jours.
Le volume de tokens réellement utilisé a été recalculé en appliquant les tarifs de référence d’un modèle de pointe au même volume d’entrée et de sortie.
Dans certaines configurations, l’orchestration des modèles permet ainsi de réduire jusqu’à 75 % les coûts d’usage de l’IA.
Cette différence s’explique par la possibilité de mobiliser des modèles et des capacités différents selon les besoins de chaque étape, plutôt que de confier l’ensemble du travail à un unique modèle de pointe.
Comment la qualité a été évaluée
Chaque comparaison portait sur deux réponses produites pour une même tâche :
- une réponse issue de l’orchestration Spotwork.AI ;
- une réponse issue du raisonnement natif du même modèle.
Les réponses étaient présentées sous les libellés A et B, sans indication de leur origine. Leur ordre était modifié pour chaque comparaison.
GPT‑4.1 a évalué les réponses selon 14 dimensions de qualité, notamment la précision, la structure, la lisibilité, la pertinence des recommandations et la gestion de l’incertitude.
En cas d’égalité, le résultat était réparti entre les deux réponses. Les notes de 8,1 et 7,4 correspondent aux moyennes obtenues sur l’ensemble des 66 comparaisons.
Comment les coûts ont été estimés
Nous avons analysé environ 7 200 appels facturés sur une période de 14 jours. À volume d’usage identique, leurs coûts ont été comparés à ceux du modèle de pointe retenu, à partir de ses tarifs de référence de juin 2026.
L’estimation porte uniquement sur les coûts d’utilisation facturés par les modèles. Elle n’intègre pas les autres coûts techniques liés au fonctionnement du système.
Périmètre et limites
Ces résultats proviennent de tests internes menés sur des tâches d’analyse et de production documentaire. Ils décrivent le périmètre évalué et ne peuvent pas être généralisés à tous les usages.
La qualité a été évaluée à l’aveugle sur 66 comparaisons anonymisées, à l’aide de GPT‑4.1. Des évaluations humaines menées sur un périmètre plus large permettront de compléter ces premiers résultats.
La comparaison des coûts porte uniquement sur l’utilisation des modèles, et non sur le coût complet de fonctionnement d’un système d’IA.
Ce que montrent ces premiers résultats
Sur le périmètre étudié, la structuration du raisonnement améliore la qualité du travail produit, tandis que l’orchestration des modèles permet de réduire leurs coûts d’usage dans certaines configurations.
Ces résultats montrent l’intérêt d’une approche dans laquelle les modèles sont intégrés à une méthode de travail structurée, évaluée et adaptée au résultat attendu.