Hier, j’ai bu environ 1 litre de café dans un café et aujourd’hui je me sens très mal, ce qui m’a empêché de coder correctement
J’ai supprimé tous les livrables de chunking/RAG produits le 17 juin comme référence de base
v1 docs_chunks.jsonl, v2 docs_chunks_v2.jsonl, livrables de catalogue/index/mapping v3/v3.1 supprimés
Scripts de brouillon de chunking/post‑processing/validation ainsi que le premier brouillon de chat/index RAG également supprimés
Le répertoire work/godot_rag/ est laissé vide afin de ne pas prendre les livrables erronés comme référence
J’ai consigné les raisons de ce nettoyage en rétrospective
Le problème était d’avoir commencé le chunking avant d’analyser suffisamment la structure de la documentation officielle
L’objectif de se baser sur l’ensemble de la documentation officielle Godot a dérivé vers un “MVP API clé” choisi arbitrairement par le LLM, avec des directions de codage dur et sur‑renforcées, ce qui a pollué le processus
J’ai noté que, sans mon instruction, ChatGPT/Codex réduisait arbitrairement le périmètre ou supposait qu’une réponse était disponible avant la fin d’une étape, générant ainsi des livrables prématurés
Lorsque les productions du LLM, les candidats regex, les références officielles et les règles approuvées par l’utilisateur se mélangent, ils ne peuvent plus servir de base fiable pour les labelliseurs/classificateurs RAG
J’ai de nouveau noté les lacunes de l’architecture actuelle
La couche d’analyse statique est faible
Absence de validation basée sur l’AST/parseur GDScript
Le graphe de dépendances du projet Godot est insuffisant
La validation d’exécution/syntaxe est faible
La taxonomie des labels reste grossière
La distinction de provenance entre les productions du LLM et les réponses validées est insuffisante
La conception de prévention des fuites de données et de la déduplication est faible
La prochaine direction de travail sera réinitialisée sur l’analyse du source godot_docs_full
Au lieu de recréer immédiatement le RAG ou le catalogue, nous analyserons d’abord le contenu de outputs/godot_docs_full/pages
Il faut vérifier comment les documents de référence de classe, de migration et de tutoriel sont structurés en Markdown
En fonction de la structure de la documentation officielle Godot, nous redéfinirons quel niveau de chunk (page, section, membre d’API) utiliser
Avant le chunking, il faut d’abord définir les critères du rapport de validation