Aller au contenu

Build in Public

Ce journal technique suit, au fil de l'eau, les briques que nous développons. Vous y voyez l'état réel des travaux (ce qui fonctionne, ce qui reste à faire, ce que disent les mesures) et non une vitrine. Les démonstrations s'appuient sur des données publiques ou fictives, déclarées comme telles.

Toutes les démonstrations sont réalisées dans des environnements de test, sans aucune donnée client.

Le format de chaque entrée

Cadrage

Périmètre, choix techniques et jeu de test sont documentés avant le premier développement.

Prototype

Première version opérante, premières mesures, difficultés identifiées et traitées.

Démonstration

Démonstration sur le jeu de test, résultats mesurés et limites exposées sans fard.

  • Maquette sur corpus synthétique

    Maquette de recherche documentaire sur dix clauses contractuelles

    Une maquette de recherche documentaire construite sur dix clauses contractuelles synthétiques (confidentialité, données personnelles, sous-traitance, réversibilité…), de quelques lignes chacune. La recherche compare la fréquence des termes de la question à celle de chaque clause ; elle n'emploie ni découpage, ni modèle de représentation vectorielle, ni génération de réponse.

    Cadrage
    Dix clauses synthétiques ; quinze questions, chacune rattachée à la clause qui y répond et aux termes que la réponse doit contenir.
    Prototype
    Recherche par similarité de la fréquence des termes, sur la clause entière ; une évaluation automatique contrôle la clause retrouvée et la présence des termes attendus.
    Démonstration
    La bonne clause arrive en tête pour 13 questions sur 15. Score composite maison (0,6 × recherche + 0,4 × présence des termes attendus) : 0,867. Ce n'est pas une évaluation RAGAS.

    Enseignements

    • Les deux échecs portent sur des questions dont la réponse figure dans le corpus (durée de l'obligation de confidentialité, informations à documenter au titre du RGPD) : la recherche par termes n'a pas fait remonter la bonne clause.
    • Le jeu ne comportait aucune question hors corpus : la capacité à refuser n'y était pas mesurée.
    • Une évaluation utile contrôle à la fois le document retrouvé et le contenu de la réponse.

    SourceCode, données et rapport publics : oppdrag-public-pocs, dossier poc-001-rag-juridique.

  • Architecture fictive, volontairement mal configurée

    Audit de configuration d'une architecture cloud fictive

    Un script d'audit appliqué à la description d'une architecture AWS fictive, volontairement mal configurée pour l'exercice : comptes, stockage et règles réseau. Aucune connexion à un compte AWS : tout est local et fictif.

    Cadrage
    Périmètre : gestion des identités, stockage, règles réseau ; sept règles de contrôle, chacune assortie d'une sévérité et d'une remédiation.
    Prototype
    Audit complet : 23 constats, dont 5 critiques, 6 élevés, 6 moyens et 6 faibles, classés par sévérité.
    Démonstration
    Rapport final, avec une remédiation proposée pour chaque constat. Les corrections n'ont pas été appliquées.

    Enseignements

    • Les cinq constats critiques relèvent de la gestion des identités (comptes administrateurs sans authentification multifacteur) et de l'exposition réseau (accès SSH et base de données ouverts à internet).
    • Un audit devrait aussi vérifier les corrections, et pas seulement détecter : c'est l'étape qui manque à cet exercice.

    SourceCode, données et rapport publics : oppdrag-public-pocs, dossier poc-004-audit-cloud-aws-fictif.

  • Essais sur le produit livré, 5 et 6 octobre 2026

    Ce que la démonstration a révélé dans Knowledge AI

    Pour la démonstration de ce site, Knowledge AI a été interrogé, depuis sa branche principale, sur un extrait public de seize articles du Code du travail. Les essais ont confirmé ce qu'ils devaient confirmer, et révélé des défauts que nous avons consignés plutôt que contournés.

    Cadrage
    Seize articles du Code du travail (Légifrance, Licence Ouverte), en trois PDF ; trois questions de dirigeant, dont une sans réponse dans le corpus.
    Prototype
    Indexation sur une base dédiée ; mesure du contrôle des preuves et reconstitution du contexte transmis au modèle, sans génération.
    Démonstration
    La question sans réponse a été refusée cinq fois sur cinq. Les deux autres ont été refusées à tort ; reformulées dans le vocabulaire du texte, elles franchissent le contrôle, mais leur génération, sur processeur seul, dépasse trois minutes.

    Enseignements

    • Un PDF protégé échouait sans explication : il est désormais mis en quarantaine avec un motif compréhensible. Un PDF endommagé doit l'être de même (issue n° 196).
    • Le contrôle des preuves compare les mots, non le sens : « prestataire » au lieu d'« entreprise extérieure » suffit à faire refuser une question légitime, avec 10 % des termes retrouvés pour un seuil de 25 % (issue n° 197).
    • Le refus ne dit pas pourquoi l'outil se tait, et suggère une référence étrangère au corpus (issue n° 198).
    • Le découpage peut séparer l'intitulé d'un article de son texte : 6 articles sur 16 sont coupés, et un passage peut citer un article sans en contenir le texte (issue n° 199).
    • La trace d'audit nomme le modèle déclaré dans la configuration, et non celui qui a répondu : c'est le défaut le plus prioritaire, car il touche la piste d'audit (issue n° 200).

    SourcesJournal de la refonte (sprint 5) et scripts de mesure ; issues n° 194 à 200 du dépôt de Knowledge AI, privé, présentées lors d'une démonstration.

Le journal de bord

Les analyses plus longues (choix d'architecture, méthodes, retours d'expérience) sont publiées dans le journal de bord.

Ouvrir le journal de bord

Un besoin comparable ?

Ces démonstrations illustrent notre manière de travailler. Exposez-nous votre projet : nous l'examinerons avec la même exigence.