Un responsable RSE ouvre ChatGPT, colle une liste de dépenses et demande un bilan carbone. La réponse arrive en quelques secondes, bien rédigée, avec des chiffres et des pourcentages. Le problème n'apparaît qu'au moment où un auditeur, un client donneur d'ordre ou l'administration demande la source de chaque facteur d'émission utilisé.

Un LLM (modèle de langage) comme ChatGPT, Claude ou Copilot excelle pour rédiger, reformuler ou expliquer un concept réglementaire. Il n'a pas été conçu pour produire un chiffre carbone opposable, c'est-à-dire un résultat que l'entreprise peut défendre devant un auditeur, un client ou une autorité. Cet article détaille ce qui distingue les deux usages, et ce qu'apporte un système de gestion carbone placé sous l'IA plutôt qu'à sa place.

Sommaire

  • Ce qu'un LLM sait bien faire
  • Pourquoi un LLM seul ne produit pas un chiffre carbone fiable
  • Ce qu'exige un chiffre carbone opposable
  • La bonne architecture : l'IA au-dessus d'un système de données
  • Comment Kabaun structure cette architecture
  • FAQ
  • Sources
  • Ce qu'un LLM sait bien faire

    Un LLM est un modèle statistique entraîné à prédire la suite la plus probable d'un texte. Cette capacité le rend utile sur plusieurs tâches liées à un bilan carbone :

  • Rédiger et reformuler : synthétiser une note méthodologique, vulgariser une exigence CSRD pour un comité de direction.
  • Expliquer un texte réglementaire : résumer une norme ESRS E1, comparer deux définitions de scope.
  • Extraire du texte non structuré : repérer une information dans un contrat fournisseur ou une facture scannée, à condition qu'un système en aval structure et valide cette extraction.
  • Générer des prompts et des trames : préparer une checklist d'audit ou des questions à poser à un fournisseur.
  • Ces usages sont couverts en détail dans nos guides sur les prompts IA pour responsable RSE et les prompts pour un rapport CSRD. Le point commun de ces usages : le LLM assiste une tâche de langage. Le calcul du bilan carbone est une tâche de données.

    Pourquoi un LLM seul ne produit pas un chiffre carbone fiable

    Le risque d'hallucination n'est pas une anecdote

    Une hallucination est une affirmation produite par un LLM qui semble plausible mais qui n'est pas vraie ni vérifiable. Selon une étude publiée par des chercheurs d'OpenAI en septembre 2025, les hallucinations proviennent en partie de la manière dont les modèles sont entraînés et évalués : un modèle qui devine une réponse plausible obtient statistiquement un meilleur score qu'un modèle qui répond « je ne sais pas », ce qui encourage la génération de réponses assurées mais non fondées.

    Appliqué à un bilan carbone, ce mécanisme est direct : demandez à un LLM le facteur d'émission d'un poste précis (un type de transport, un matériau, un procédé industriel), et il peut produire un nombre plausible, correctement formaté, sans lien vérifiable avec une base de données officielle. Rien dans la réponse ne permet de distinguer un facteur réel d'un facteur halluciné.

    Aucune donnée d'activité structurée ni historisée

    Un bilan carbone se construit à partir de données d'activité : litres de carburant consommés, kWh achetés, kilomètres parcourus, tonnes de matière achetée. Un LLM généraliste n'a pas de mémoire structurée de ces données : il traite le texte collé dans la conversation, sans base persistante reliant chaque donnée à sa source (facture, relevé, déclaration fournisseur), ni historique d'un exercice à l'autre.

    Des facteurs d'émission non sourcés ni versionnés

    Le GHG Protocol Corporate Standard, référence méthodologique internationale pour la comptabilité carbone des entreprises, repose sur la conversion d'une donnée d'activité en émissions grâce à un facteur d'émission documenté. Une base de facteurs sérieuse (Base Carbone de l'ADEME, DEFRA, EPA) associe chaque facteur à une source, une méthodologie et une date de mise à jour. Un LLM interrogé sans connexion à une base vérifiée ne peut garantir ni la source, ni la version, ni la date de validité du facteur qu'il restitue.

    Un calcul non déterministe et non reproductible

    Un LLM génère ses réponses de façon probabiliste : poser deux fois la même question peut produire deux formulations, et parfois deux résultats, légèrement différents. Un bilan carbone opposable doit au contraire être reproductible : le même jeu de données d'activité et le même facteur d'émission doivent produire exactement le même résultat, année après année, pour permettre une comparaison dans le temps et une vérification par un tiers.

    Aucune consolidation multi-entités ni gestion de périmètre

    Un groupe avec plusieurs filiales, sites ou entités juridiques doit consolider ses données selon un périmètre défini (contrôle opérationnel, financier ou part du capital, au sens du GHG Protocol). Cette consolidation suppose une structure de données organisée par entité et par site, avec des règles d'agrégation cohérentes. Un LLM ne maintient pas cette structure : chaque conversation repart d'un texte, pas d'un modèle de données.

    Aucune piste d'audit

    Un auditeur ou un vérificateur qui contrôle un bilan carbone cherche à retracer chaque chiffre jusqu'à sa source : qui a saisi la donnée, quand, avec quel justificatif, quel facteur a été appliqué et par qui a-t-il été validé. Une conversation avec un LLM ne produit aucune piste d'audit horodatée et inaltérable de ce type.

    Ce qu'exige un chiffre carbone opposable

    Un chiffre carbone devient opposable, c'est-à-dire défendable devant un tiers, quand il répond à des exigences que le format conversationnel d'un LLM ne couvre pas nativement :

  • Traçabilité : une source documentaire pour chaque donnée. Un LLM seul n'a pas de mémoire structurée reliée à une pièce justificative.
  • Facteurs sourcés : une base de facteurs officielle, datée et versionnée. Un LLM seul n'a pas de connexion vérifiée à une base publique.
  • Reproductibilité : mêmes données et même facteur, même résultat. Un LLM génère de façon probabiliste, sans garantie de résultat identique.
  • Périmètre de consolidation : des règles de contrôle opérationnel ou financier par entité. Un LLM seul n'a pas de modèle de données multi-entités.
  • Piste d'audit : un historique horodaté des saisies et des validations. Une conversation ne laisse aucune trace persistante de ce type.
  • Contrôle humain : une validation explicite avant publication. Un LLM seul n'intègre aucun mécanisme de validation.
  • Ces exigences ne sont pas propres à la CSRD : elles découlent directement de la méthodologie du GHG Protocol, décrite dans notre article sur la comptabilité carbone, et de la logique des facteurs d'émission sourcés.

    La bonne architecture : l'IA au-dessus d'un système de données

    L'erreur n'est pas d'utiliser l'IA pour le carbone, c'est de lui demander de remplacer le système au lieu d'agir dessus. Une architecture fiable place le LLM au-dessus d'un système structuré, plutôt qu'à la place de ce système : certains acteurs du secteur décrivent cette couche de données structurées, historisées et sourcées comme le socle, ou « système d'exploitation », sur lequel l'IA opère, par analogie avec le système d'exploitation d'un ordinateur qui organise les ressources sous les applications.

    Concrètement, cela signifie :

  • Une base de données d'activité persistante, où chaque ligne est reliée à une source et historisée par exercice.
  • Une base de facteurs d'émission sourcée et versionnée, mise à jour et documentée, plutôt qu'un chiffre généré à la volée.
  • Un moteur de calcul déterministe, conforme au GHG Protocol, qui applique toujours la même règle au même jeu de données.
  • Une couche IA qui agit via des outils, sur ces données structurées, plutôt que sur un texte collé dans une conversation.
  • Une validation humaine explicite avant que toute action ou tout chiffre proposé par l'IA n'entre dans le bilan final.
  • Cette logique agentique, où l'IA agit via des outils audités plutôt que de générer une réponse isolée, est détaillée dans notre article sur l'agent IA carbone. Elle rejoint aussi les critères de choix développés dans notre grille sur le logiciel RSE IA : ce qui distingue un outil fiable n'est pas la présence d'un chatbot, mais l'endroit précis où l'IA intervient dans la chaîne de données. Une fois cette architecture en place, l'automatisation devient pertinente poste par poste, comme détaillé dans notre article sur l'automatisation du bilan carbone.

    Comment Kabaun structure cette architecture

    Kabaun est une plateforme de gestion carbone construite sur cette logique : les données d'abord, l'IA au-dessus, la validation humaine avant chaque action structurante.

  • Un moteur de calcul conforme au GHG Protocol Corporate Standard (code produit CBC-001), avec des facteurs d'émission sourcés issus de bases publiques référencées (ADEME, DEFRA, EPA, entre autres), plutôt qu'un chiffre généré par un modèle de langage.
  • Une gestion multi-entités et multi-sites avec consolidation au niveau groupe (GDD-004), pour couvrir le périmètre réel d'une organisation.
  • Klem, l'assistant IA de Kabaun, répond aux questions en langage naturel sur les données du bilan (IA-004) et agit comme agent sur des tâches précises : extraction de factures, rapprochement de lignes comptables, détection d'anomalies à l'import, simulation de trajectoires de réduction (IA-007). Chaque action reste soumise à validation : « Klem propose, vous validez ».
  • Une architecture MCP native (IA-006), qui permet à des agents IA externes d'opérer sur les données carbone du client de façon auditable.
  • Une piste d'audit complète et inaltérable (CERT-003), qui trace chaque saisie, chaque modification et chaque validation avec horodatage et auteur identifié.
  • FAQ

    ChatGPT peut-il faire un bilan carbone fiable pour une entreprise ?

    ChatGPT peut aider à rédiger une méthodologie ou expliquer une notion, mais il ne dispose pas nativement d'une base de facteurs d'émission sourcée et versionnée, ni d'une mémoire structurée des données d'activité de l'entreprise. Sans connexion vérifiée à des données et des facteurs fiables, un résultat produit par ChatGPT seul n'est pas opposable devant un auditeur ou un client.

    Peut-on utiliser un LLM comme ChatGPT ou Claude pour préparer un rapport CSRD ?

    Un LLM aide utilement à rédiger, résumer ou vulgariser un contenu CSRD, comme détaillé dans notre guide de prompts pour un rapport CSRD. Il ne remplace pas le calcul du bilan sous-jacent (ESRS E1), qui exige des données sourcées, un calcul reproductible selon le GHG Protocol et une piste d'audit vérifiable par un tiers.

    Qu'est-ce qu'une hallucination d'IA appliquée à un chiffre carbone ?

    Une hallucination est une réponse générée par un LLM qui semble plausible mais n'est pas fondée sur une source vérifiable. Selon une étude de chercheurs d'OpenAI publiée en 2025, ce phénomène découle en partie de mécanismes d'entraînement qui récompensent une réponse assurée plutôt qu'un aveu d'incertitude. Un facteur d'émission halluciné a la même forme numérique qu'un facteur réel, sans en avoir la source.

    Pourquoi un calcul carbone doit-il être reproductible ?

    Un bilan carbone est comparé d'une année sur l'autre et vérifié par des tiers (auditeurs, clients, administration). Si le même jeu de données et le même facteur d'émission produisent des résultats différents selon le moment de la génération, la comparaison et la vérification deviennent impossibles. Un moteur de calcul déterministe garantit qu'une même entrée produit toujours la même sortie.

    Quelle est la différence entre un chatbot IA et un agent IA carbone ?

    Un chatbot répond à des questions dans une conversation. Un agent IA carbone agit sur des données réelles via des outils : il peut extraire une facture, rattacher une ligne comptable à un poste d'émission ou signaler une incohérence, tout en laissant la validation finale à un humain. Cette distinction est détaillée dans notre article sur l'agent IA carbone.

    Un LLM connecté à une base de données résout-il ces limites ?

    En partie. Connecter un LLM à une base de facteurs sourcée et à des données d'activité structurées réduit le risque d'hallucination et améliore la traçabilité. Il reste nécessaire d'ajouter un moteur de calcul déterministe, une gestion de périmètre multi-entités et une piste d'audit, pour transformer une réponse générée en chiffre opposable devant un tiers.

    Conclusion

    Un LLM seul rédige bien et explique bien, mais il ne dispose ni de données d'activité structurées, ni de facteurs d'émission sourcés, ni d'un calcul reproductible, ni d'une piste d'audit : les quatre éléments qu'exige un chiffre carbone opposable. La bonne architecture place l'IA au-dessus d'un système de données fiable, avec une validation humaine avant chaque action, plutôt qu'à la place de ce système.

    Avant d'utiliser l'IA pour votre bilan carbone, vérifiez que la réponse produite s'appuie sur une source de données traçable et un facteur d'émission daté, pas seulement sur une formulation convaincante.

    Klem, l'assistant IA de Kabaun, agit sur vos données carbone sous validation humaine → www.kabaun.com/klem

    Sources

  • Kalai, Nachum, Zhang (OpenAI), Vempala (Georgia Tech), « Why Language Models Hallucinate », arXiv:2509.04664, septembre 2025 · recherche académique. arxiv.org
  • GHG Protocol, « Corporate Standard » · référentiel méthodologique international. ghgprotocol.org