AI evidence reconstruction is the practice of establishing, after the fact and from records that were never created for the purpose, what an AI system actually did — in a form a third party can re-verify and challenge without relying on the word of the party that produced it.
It is not another governance activity to add to the list. It is what an organisation does when its governance has to explain itself — and it begins the moment someone asks a question the original project never planned to answer.
Organisations have always had to account for consequential decisions long after the moment passed. What changed is that the decisions are now made or shaped by systems that leave scattered, partial, ungraded traces — and that the people who could explain them are frequently gone by the time anyone asks.
The problem it addresses
Between the moment an AI system acts and the moment someone asks about it, three things reliably happen. People leave. Records rotate, get archived, or are quietly superseded. And documentation drifts away from what the system actually does.
By the time the question arrives — from a regulator, an auditor, a claimant, an acquirer, or an internal committee — the organisation typically holds a large volume of material and no way to say what any of it is worth. That is the gap. Not missing data: ungraded data.
Where it sits in the lifecycle
Every governance activity has a place in the life of an AI system. Most of them run forward — they shape what happens next. Reconstruction is the only one that runs backwards.
AI system lifecycle
Idea
Risk assessment
Approval
Development
Testing
Deployment
Runtime
Incident
the record is created here
— or it isn't
Investigation
Audit
Regulatory response
Litigation
the question is asked here
Reconstruction is invoked at the bottom and reaches back across everything above it — using only what the stages above happened to leave behind.
That is the whole difficulty, and the whole reason the practice exists. Nobody at the top of that list was working for a reader at the bottom of it. The approval was recorded to get the project moving, not to be re-examined in three years. The traces were emitted to help an engineer debug, not to convince a regulator. Reconstruction begins where operational memory ends — when the people who could explain it have gone, the records were never designed to answer the question, and someone outside is waiting for an answer anyway.
What counts as an observation
Reconstruction is often assumed to mean "read the logs". It does not. An observation is anything that records something about the system or the decision, whatever produced it: runtime traces and application logs, yes — but equally approval records, test results and their reports, certification and assessment findings, change tickets, source control history, policy and configuration versions, decisions taken in meetings, and interviews with the people who were there.
The provenance ladder exists precisely because those sources are not worth the same. If everything came from runtime telemetry there would be no need for a ladder — every fact would sit at the same level. An interview is a fact stated by a party. A test report is a fact a system recorded. An external certification is a fact independently attested. All three belong in the record; what changes is the weight each carries, and whether that weight is stated out loud.
This is why a human account is not excluded from an evidence file. It is included, and graded — which is the opposite of both ignoring it and taking it at face value.
What it is not
The term sits next to several disciplines that solve genuinely different problems. Confusing them is the most common source of disappointment.
Observability tells you what a system is doing now, for the people operating it. It is present-tense and insider-facing, built to help you fix things rather than to convince someone who doubts you. An observability stack is an excellent input to a reconstruction and a poor substitute for one.
Monitoring and drift detection tell you that a metric moved. That is a signal, not an account. Knowing that model performance degraded in March does not establish which decision was made, on what basis, or who was accountable for it.
Explainability (XAI) tells you which features influenced a model's output. It explains a model. Reconstruction explains a decision made by an organisation — under a policy version, with a configuration, at a time, with or without human review. A perfect feature attribution tells you nothing about whether the required approval happened.
Audit trails and logging record that events occurred, in an order. They rarely carry who held authority, what the decision rested on, or whether anything outside the system corroborates the entry. See why a perfect log can document an unauthorized decision.
Digital forensics is the closest relative, and the methods overlap. Forensics is generally artifact- and device-centric, oriented toward recovering what someone tried to hide. Evidence reconstruction assumes nothing was hidden — only that nothing was prepared — and its central concern is grading the weight of what survives rather than recovering what was deleted.
GRC and compliance platforms organise obligations, controls, owners and due dates. They record that a control exists. They are not built to establish that it operated. That distinction is the whole subject.
What a reconstruction produces
Not a score. Not a verdict. Not a risk rating. A reconstruction produces an ordered account of what happened in which every fact carries three things: where it came from, who or what recorded it, and how far it can be stood behind independently. Alongside it sits an explicit statement of the questions the record cannot answer.
Provenance is attached to every fact, and it is graded. A statement made by management and a fact attested by a system nobody in the decision chain controls are both facts. They are not worth the same, and an account that flattens them into a single list has destroyed the only information that mattered. In practice this means a ladder: unverifiable, stated by a party, system-recorded, independently corroborated, sealed, externally attested. Where an account sits on that ladder is usually more informative than what it says.
Declared and observed are held apart, not reconciled. The policy declared that human review was required. The runtime shows none occurred. Both belong in the record. The value lies precisely in presenting them side by side rather than silently preferring one. A system that resolves the contradiction for you has made a judgement it was not entitled to make.
What was never recorded is stated as not assessable. This is the property that decides whether an account survives contact with a hostile reader. If the evidence for a control does not exist, the honest output is not assessable — not "compliant", not "low risk", not a score carrying a footnote. Naming the gaps is what makes the non-gaps credible.
The underlying principle is that no part of the account may exempt itself from being checked — including the account's own limitations, which is why an honest evidence artifact states them on its face.
Who needs it, and when
The same reconstruction is read by different professions, each of which calls it something else and expects it in the shape of a document they already produce.
- An investigator needs a timeline and a root cause.
- An internal auditor needs working papers with evidence references and exceptions.
- A compliance team needs to know which obligations can actually be demonstrated today, and why not the others.
- A regulator response needs a formal answer, request by request, including the matters that cannot presently be demonstrated.
- An acquirer needs the governance liabilities that survive the transaction.
- Counsel needs established facts, an intact chain of custody, and an honest list of unknowns.
These are not six products. They are six readings of one reconstruction — which is why the practice is defined by the account it builds, not by the report it prints.
Where it stops
Reconstruction is a second-best, and saying so is part of doing it properly. Contemporaneous evidence — recorded, timestamped and externally anchored at the moment of the decision — is strictly stronger than anything rebuilt afterwards. If you have it, you do not need this. Reconstruction exists because in almost every real deployment it was not done.
Some things stay out of reach regardless of method: whether a human who approved something actually read it, the reasoning inside a model's forward pass, anything that occurred in a system that wrote no durable record, and the state of an external source that has since changed. A citation is a pointer, not custody.
And reconstruction is not certification. It establishes facts and grades them. Whether those facts are acceptable — against a regulation, a risk appetite, or a contract — is a judgement that belongs to an auditor, a lawyer, a regulator or a board, and should never be made by the tool that assembled the evidence. The layer that produces evidence must not be the layer that decides whether the evidence suffices.
What one actually looks like
A definition is worth less than an artifact. A complete evidence package — reconstructed from a public record that was never produced for governance — is published in full, including the SHA-256 manifest and an RFC 3161 timestamp token you can verify yourself with openssl.
If you want one for a system of your own, we run it with you, where your data already is — on your infrastructure or in your VPC, with nothing leaving your environment.
See the evidence package →Ask for a run on your system →
Also read: How do you reconstruct what an AI agent did when nothing was instrumented? · AI observability vs AI evidence · How do you prove a control actually ran? · How to collect audit evidence for AI agents. The theoretical basis, No Exempt Node, is published and citable: Zenodo record 21402662.
La reconstitution de preuve IA est la pratique consistant à établir, après coup et à partir d'enregistrements qui n'ont jamais été créés pour cela, ce qu'un système IA a réellement fait — sous une forme qu'un tiers peut re-vérifier et contester sans avoir à croire sur parole la partie qui l'a produite.
Ce n'est pas une activité de gouvernance de plus à ajouter à la liste. C'est ce que fait une organisation quand sa gouvernance doit s'expliquer — et cela commence au moment où quelqu'un pose une question à laquelle le projet initial n'avait jamais prévu de répondre.
Les organisations ont toujours dû rendre compte de décisions lourdes de conséquences longtemps après coup. Ce qui a changé, c'est que ces décisions sont désormais prises ou façonnées par des systèmes qui laissent des traces éparses, partielles et non graduées — et que les personnes capables de les expliquer sont souvent parties au moment où l'on demande.
Le problème qu'elle traite
Entre le moment où un système IA agit et celui où quelqu'un pose la question, trois choses se produisent immanquablement. Les gens partent. Les enregistrements tournent, sont archivés ou discrètement remplacés. Et la documentation dérive de ce que le système fait réellement.
Quand la question arrive — d'un régulateur, d'un auditeur, d'un plaignant, d'un acquéreur ou d'un comité interne — l'organisation détient en général un gros volume de matière et aucun moyen de dire ce qu'elle vaut. C'est là qu'est l'écart. Pas des données manquantes : des données non graduées.
Où elle se situe dans le cycle de vie
Chaque activité de gouvernance a sa place dans la vie d'un système d'IA. La plupart vont vers l'avant : elles façonnent ce qui va se passer. La reconstitution est la seule qui remonte le temps.
Cycle de vie d'un système d'IA
Idée
Analyse de risque
Approbation
Développement
Tests
Déploiement
Exécution
Incident
c'est ici que la trace se crée
— ou pas
Enquête
Audit
Réponse au régulateur
Contentieux
c'est ici que la question est posée
La reconstitution est convoquée en bas et remonte tout ce qui précède — avec pour seul matériau ce que les étapes du haut ont laissé derrière elles.
C'est là toute la difficulté, et toute la raison d'être de cette pratique. Personne, en haut de cette liste, ne travaillait pour un lecteur situé en bas. L'approbation a été consignée pour lancer le projet, pas pour être réexaminée trois ans plus tard. Les traces ont été émises pour aider un ingénieur à déboguer, pas pour convaincre un régulateur. La reconstitution commence là où s'arrête la mémoire opérationnelle — quand ceux qui pouvaient expliquer sont partis, que les enregistrements n'ont jamais été conçus pour répondre à la question, et que quelqu'un, dehors, attend quand même une réponse.
Ce qui compte comme observation
On suppose souvent que reconstituer veut dire « lire les logs ». Non. Une observation, c'est tout ce qui enregistre quelque chose sur le système ou sur la décision, quelle qu'en soit la source : traces d'exécution et logs applicatifs, oui — mais tout autant les enregistrements d'approbation, les résultats de tests et leurs rapports, les constats de certification et d'évaluation, les tickets de changement, l'historique du gestionnaire de sources, les versions de politique et de configuration, les décisions prises en réunion, et les entretiens avec les personnes qui étaient là.
L'échelle de provenance existe précisément parce que ces sources ne valent pas la même chose. Si tout venait de la télémétrie d'exécution, aucune échelle ne serait nécessaire — chaque fait serait au même niveau. Un entretien est un fait affirmé par une partie. Un rapport de test est un fait enregistré par un système. Une certification externe est un fait attesté indépendamment. Les trois appartiennent au dossier ; ce qui change, c'est le poids de chacun, et le fait qu'il soit énoncé à voix haute.
C'est pourquoi un témoignage humain n'est pas exclu d'un dossier de preuve. Il y est inclus, et gradué — ce qui est l'inverse à la fois de l'ignorer et de le prendre pour argent comptant.
Ce que ce n'est pas
Le terme voisine avec plusieurs disciplines qui résolvent des problèmes réellement différents. Les confondre est la première source de déception.
L'observabilité vous dit ce qu'un système fait maintenant, pour ceux qui l'exploitent. Elle est au présent et tournée vers l'intérieur, faite pour vous aider à réparer, pas à convaincre quelqu'un qui doute de vous. Une pile d'observabilité est une excellente entrée pour une reconstitution, et un mauvais substitut.
Le monitoring et la détection de dérive vous disent qu'une métrique a bougé. C'est un signal, pas un récit. Savoir que la performance du modèle s'est dégradée en mars n'établit ni quelle décision a été prise, ni sur quelle base, ni qui en répondait.
L'explicabilité (XAI) vous dit quelles variables ont influencé la sortie d'un modèle. Elle explique un modèle. La reconstitution explique une décision prise par une organisation — sous une version de politique, avec une configuration, à un instant, avec ou sans revue humaine. Une attribution de variables parfaite ne dit rien sur le fait que l'approbation requise a eu lieu.
Les pistes d'audit et les journaux enregistrent que des événements ont eu lieu, dans un ordre. Ils portent rarement qui détenait l'autorité, sur quoi la décision reposait, ni si quelque chose d'extérieur corrobore l'entrée. Voir pourquoi un journal parfait peut documenter une décision non autorisée.
La forensique numérique est la parente la plus proche, et les méthodes se recoupent. La forensique est généralement centrée sur l'artefact et l'appareil, tournée vers la récupération de ce que quelqu'un a tenté de cacher. La reconstitution de preuve suppose que rien n'a été caché — seulement que rien n'avait été préparé — et sa préoccupation centrale est de graduer le poids de ce qui subsiste, pas de récupérer ce qui a été effacé.
Les plateformes GRC et conformité organisent obligations, contrôles, propriétaires et échéances. Elles enregistrent qu'un contrôle existe. Elles ne sont pas faites pour établir qu'il a opéré. Cette distinction est tout le sujet.
Ce que produit une reconstitution
Pas un score. Pas un verdict. Pas une note de risque. Une reconstitution produit un récit ordonné de ce qui s'est passé, où chaque fait porte trois choses : d'où il vient, qui ou quoi l'a enregistré, et jusqu'où on peut s'y tenir de façon indépendante. À côté figure l'énoncé explicite des questions auxquelles le dossier ne peut pas répondre.
La provenance est attachée à chaque fait, et elle est graduée. Une affirmation de la direction et un fait attesté par un système que personne dans la chaîne de décision ne contrôle sont deux faits. Ils ne valent pas la même chose, et un récit qui les aplatit dans une seule liste a détruit la seule information qui comptait. En pratique cela donne une échelle : invérifiable, affirmé par une partie, enregistré par un système, corroboré indépendamment, scellé, attesté par un tiers externe. Où se situe un récit sur cette échelle est souvent plus informatif que ce qu'il dit.
Le déclaré et l'observé sont tenus à part, non réconciliés. La politique déclarait la revue humaine obligatoire. Le runtime montre qu'il n'y en a pas eu. Les deux appartiennent au dossier. La valeur tient précisément à les présenter côte à côte plutôt qu'à en préférer un silencieusement. Un système qui tranche la contradiction à votre place a porté un jugement auquel il n'avait pas droit.
Ce qui n'a jamais été enregistré est déclaré non évaluable. C'est la propriété qui décide si un récit survit au contact d'un lecteur hostile. Si la preuve d'un contrôle n'existe pas, la sortie honnête est non évaluable — pas « conforme », pas « risque faible », pas un score assorti d'une note. Nommer les trous, c'est ce qui rend crédible ce qui n'en est pas.
Le principe sous-jacent est qu'aucune partie du récit ne peut s'exempter d'être vérifiée — y compris les limites du récit lui-même, ce qui explique qu'un artefact de preuve honnête les énonce en clair.
Qui en a besoin, et quand
La même reconstitution est lue par des métiers différents, dont chacun l'appelle autrement et l'attend sous la forme d'un document qu'il produit déjà.
- Un enquêteur a besoin d'une chronologie et d'une cause racine.
- Un auditeur interne a besoin de feuilles de travail avec références de preuve et exceptions.
- Une équipe conformité a besoin de savoir quelles obligations sont réellement démontrables aujourd'hui, et pourquoi pas les autres.
- Une réponse à un régulateur a besoin d'un document formel, demande par demande, incluant ce qui ne peut pas être démontré.
- Un acquéreur a besoin du passif de gouvernance qui survit à la transaction.
- Un avocat a besoin de faits établis, d'une chaîne de possession intacte, et d'une liste honnête d'inconnues.
Ce ne sont pas six produits. Ce sont six lectures d'une seule reconstitution — c'est pourquoi la pratique se définit par le récit qu'elle bâtit, pas par le rapport qu'elle imprime.
Où elle s'arrête
La reconstitution est un second choix, et le dire fait partie du travail bien fait. La preuve contemporaine — enregistrée, horodatée et ancrée à l'extérieur au moment de la décision — est strictement supérieure à tout ce qu'on rebâtit après coup. Si vous l'avez, vous n'avez pas besoin de ceci. La reconstitution existe parce que, dans presque tout déploiement réel, cela n'a pas été fait.
Certaines choses restent hors de portée quelle que soit la méthode : si l'humain qui a approuvé a réellement lu, le raisonnement interne d'un modèle, tout ce qui s'est produit dans un système sans trace durable, et l'état d'une source externe modifiée depuis. Une citation est un pointeur, pas une garde.
Et la reconstitution n'est pas une certification. Elle établit des faits et les gradue. Savoir si ces faits sont acceptables — au regard d'une réglementation, d'un appétit au risque ou d'un contrat — est un jugement qui appartient à un auditeur, un avocat, un régulateur ou un conseil, et ne devrait jamais être rendu par l'outil qui a assemblé la preuve. La couche qui produit la preuve ne doit pas être celle qui décide si la preuve suffit.
À quoi ça ressemble vraiment
Une définition vaut moins qu'un artefact. Un paquet de preuve complet — reconstitué depuis un enregistrement public qui n'a jamais été produit à des fins de gouvernance — est publié en entier, avec son manifeste SHA-256 et un jeton d'horodatage RFC 3161 que vous pouvez vérifier vous-même au openssl.
Si vous en voulez un pour un système à vous, nous le faisons tourner avec vous, là où vos données se trouvent déjà — sur votre infrastructure ou dans votre VPC, sans que rien ne sorte de votre environnement.
Voir le paquet de preuve →Demander un passage sur votre système →
À lire aussi : Comment reconstituer ce qu'un agent IA a fait quand rien n'était instrumenté ? · Observabilité IA vs preuve IA · Comment prouver qu'un contrôle a réellement tourné ? · Collecter la preuve d'audit pour les agents IA. La base théorique, No Exempt Node, est publiée et citable : Zenodo, enregistrement 21402662.