Un responsable RSE ouvre ChatGPT, colle une liste de dépenses et demande un bilan carbone. La réponse arrive en quelques secondes, bien rédigée, avec des chiffres et des pourcentages. Le problème n'apparaît qu'au moment où un auditeur, un client donneur d'ordre ou l'administration demande la source de chaque facteur d'émission utilisé.
Un LLM (modèle de langage) comme ChatGPT, Claude ou Copilot excelle pour rédiger, reformuler ou expliquer un concept réglementaire. Il n'a pas été conçu pour produire un chiffre carbone opposable, c'est-à-dire un résultat que l'entreprise peut défendre devant un auditeur, un client ou une autorité. Cet article détaille ce qui distingue les deux usages, et ce qu'apporte un système de gestion carbone placé sous l'IA plutôt qu'à sa place.
Sommaire
Ce qu'un LLM sait bien faire
Un LLM est un modèle statistique entraîné à prédire la suite la plus probable d'un texte. Cette capacité le rend utile sur plusieurs tâches liées à un bilan carbone :
Ces usages sont couverts en détail dans nos guides sur les prompts IA pour responsable RSE et les prompts pour un rapport CSRD. Le point commun de ces usages : le LLM assiste une tâche de langage. Le calcul du bilan carbone est une tâche de données.
Pourquoi un LLM seul ne produit pas un chiffre carbone fiable
Le risque d'hallucination n'est pas une anecdote
Une hallucination est une affirmation produite par un LLM qui semble plausible mais qui n'est pas vraie ni vérifiable. Selon une étude publiée par des chercheurs d'OpenAI en septembre 2025, les hallucinations proviennent en partie de la manière dont les modèles sont entraînés et évalués : un modèle qui devine une réponse plausible obtient statistiquement un meilleur score qu'un modèle qui répond « je ne sais pas », ce qui encourage la génération de réponses assurées mais non fondées.
Appliqué à un bilan carbone, ce mécanisme est direct : demandez à un LLM le facteur d'émission d'un poste précis (un type de transport, un matériau, un procédé industriel), et il peut produire un nombre plausible, correctement formaté, sans lien vérifiable avec une base de données officielle. Rien dans la réponse ne permet de distinguer un facteur réel d'un facteur halluciné.
Aucune donnée d'activité structurée ni historisée
Un bilan carbone se construit à partir de données d'activité : litres de carburant consommés, kWh achetés, kilomètres parcourus, tonnes de matière achetée. Un LLM généraliste n'a pas de mémoire structurée de ces données : il traite le texte collé dans la conversation, sans base persistante reliant chaque donnée à sa source (facture, relevé, déclaration fournisseur), ni historique d'un exercice à l'autre.
Des facteurs d'émission non sourcés ni versionnés
Le GHG Protocol Corporate Standard, référence méthodologique internationale pour la comptabilité carbone des entreprises, repose sur la conversion d'une donnée d'activité en émissions grâce à un facteur d'émission documenté. Une base de facteurs sérieuse (Base Carbone de l'ADEME, DEFRA, EPA) associe chaque facteur à une source, une méthodologie et une date de mise à jour. Un LLM interrogé sans connexion à une base vérifiée ne peut garantir ni la source, ni la version, ni la date de validité du facteur qu'il restitue.
Un calcul non déterministe et non reproductible
Un LLM génère ses réponses de façon probabiliste : poser deux fois la même question peut produire deux formulations, et parfois deux résultats, légèrement différents. Un bilan carbone opposable doit au contraire être reproductible : le même jeu de données d'activité et le même facteur d'émission doivent produire exactement le même résultat, année après année, pour permettre une comparaison dans le temps et une vérification par un tiers.
Aucune consolidation multi-entités ni gestion de périmètre
Un groupe avec plusieurs filiales, sites ou entités juridiques doit consolider ses données selon un périmètre défini (contrôle opérationnel, financier ou part du capital, au sens du GHG Protocol). Cette consolidation suppose une structure de données organisée par entité et par site, avec des règles d'agrégation cohérentes. Un LLM ne maintient pas cette structure : chaque conversation repart d'un texte, pas d'un modèle de données.
Aucune piste d'audit
Un auditeur ou un vérificateur qui contrôle un bilan carbone cherche à retracer chaque chiffre jusqu'à sa source : qui a saisi la donnée, quand, avec quel justificatif, quel facteur a été appliqué et par qui a-t-il été validé. Une conversation avec un LLM ne produit aucune piste d'audit horodatée et inaltérable de ce type.
Ce qu'exige un chiffre carbone opposable
Un chiffre carbone devient opposable, c'est-à-dire défendable devant un tiers, quand il répond à des exigences que le format conversationnel d'un LLM ne couvre pas nativement :
Ces exigences ne sont pas propres à la CSRD : elles découlent directement de la méthodologie du GHG Protocol, décrite dans notre article sur la comptabilité carbone, et de la logique des facteurs d'émission sourcés.
La bonne architecture : l'IA au-dessus d'un système de données
L'erreur n'est pas d'utiliser l'IA pour le carbone, c'est de lui demander de remplacer le système au lieu d'agir dessus. Une architecture fiable place le LLM au-dessus d'un système structuré, plutôt qu'à la place de ce système : certains acteurs du secteur décrivent cette couche de données structurées, historisées et sourcées comme le socle, ou « système d'exploitation », sur lequel l'IA opère, par analogie avec le système d'exploitation d'un ordinateur qui organise les ressources sous les applications.
Concrètement, cela signifie :
Cette logique agentique, où l'IA agit via des outils audités plutôt que de générer une réponse isolée, est détaillée dans notre article sur l'agent IA carbone. Elle rejoint aussi les critères de choix développés dans notre grille sur le logiciel RSE IA : ce qui distingue un outil fiable n'est pas la présence d'un chatbot, mais l'endroit précis où l'IA intervient dans la chaîne de données. Une fois cette architecture en place, l'automatisation devient pertinente poste par poste, comme détaillé dans notre article sur l'automatisation du bilan carbone.
Comment Kabaun structure cette architecture
Kabaun est une plateforme de gestion carbone construite sur cette logique : les données d'abord, l'IA au-dessus, la validation humaine avant chaque action structurante.
FAQ
ChatGPT peut-il faire un bilan carbone fiable pour une entreprise ?
ChatGPT peut aider à rédiger une méthodologie ou expliquer une notion, mais il ne dispose pas nativement d'une base de facteurs d'émission sourcée et versionnée, ni d'une mémoire structurée des données d'activité de l'entreprise. Sans connexion vérifiée à des données et des facteurs fiables, un résultat produit par ChatGPT seul n'est pas opposable devant un auditeur ou un client.
Peut-on utiliser un LLM comme ChatGPT ou Claude pour préparer un rapport CSRD ?
Un LLM aide utilement à rédiger, résumer ou vulgariser un contenu CSRD, comme détaillé dans notre guide de prompts pour un rapport CSRD. Il ne remplace pas le calcul du bilan sous-jacent (ESRS E1), qui exige des données sourcées, un calcul reproductible selon le GHG Protocol et une piste d'audit vérifiable par un tiers.
Qu'est-ce qu'une hallucination d'IA appliquée à un chiffre carbone ?
Une hallucination est une réponse générée par un LLM qui semble plausible mais n'est pas fondée sur une source vérifiable. Selon une étude de chercheurs d'OpenAI publiée en 2025, ce phénomène découle en partie de mécanismes d'entraînement qui récompensent une réponse assurée plutôt qu'un aveu d'incertitude. Un facteur d'émission halluciné a la même forme numérique qu'un facteur réel, sans en avoir la source.
Pourquoi un calcul carbone doit-il être reproductible ?
Un bilan carbone est comparé d'une année sur l'autre et vérifié par des tiers (auditeurs, clients, administration). Si le même jeu de données et le même facteur d'émission produisent des résultats différents selon le moment de la génération, la comparaison et la vérification deviennent impossibles. Un moteur de calcul déterministe garantit qu'une même entrée produit toujours la même sortie.
Quelle est la différence entre un chatbot IA et un agent IA carbone ?
Un chatbot répond à des questions dans une conversation. Un agent IA carbone agit sur des données réelles via des outils : il peut extraire une facture, rattacher une ligne comptable à un poste d'émission ou signaler une incohérence, tout en laissant la validation finale à un humain. Cette distinction est détaillée dans notre article sur l'agent IA carbone.
Un LLM connecté à une base de données résout-il ces limites ?
En partie. Connecter un LLM à une base de facteurs sourcée et à des données d'activité structurées réduit le risque d'hallucination et améliore la traçabilité. Il reste nécessaire d'ajouter un moteur de calcul déterministe, une gestion de périmètre multi-entités et une piste d'audit, pour transformer une réponse générée en chiffre opposable devant un tiers.
Conclusion
Un LLM seul rédige bien et explique bien, mais il ne dispose ni de données d'activité structurées, ni de facteurs d'émission sourcés, ni d'un calcul reproductible, ni d'une piste d'audit : les quatre éléments qu'exige un chiffre carbone opposable. La bonne architecture place l'IA au-dessus d'un système de données fiable, avec une validation humaine avant chaque action, plutôt qu'à la place de ce système.
Avant d'utiliser l'IA pour votre bilan carbone, vérifiez que la réponse produite s'appuie sur une source de données traçable et un facteur d'émission daté, pas seulement sur une formulation convaincante.
Klem, l'assistant IA de Kabaun, agit sur vos données carbone sous validation humaine → www.kabaun.com/klem


