14 juin 2026
Réflexion à bord du bus en direction de Séoul sur le dataset/RAG pipeline de Godot 4
- Au départ, l’idée était de crawler la documentation officielle de Godot, de convertir les projets GitHub en formats
mdetjsonl, puis d’utiliser un chatbot RAG pour déterminer si le projet concernait Godot 3 ou 4 - Mais il est devenu douteux de pouvoir placer l’ensemble du contexte du projet et les extraits de documentation officielle dans le même contexte d’entrée du modèle
- Au départ, l’idée était de crawler la documentation officielle de Godot, de convertir les projets GitHub en formats
Analyse des limites du contexte d’entrée d’un chatbot RAG
- Un projet GitHub comprend README, arborescence de répertoires, multiples fichiers
.gd, scènes, chemins de ressources, etc. - Ajouter les documents officiels récupérés par le RAG gonfle l’entrée, rendant plus crucial la sélection des fichiers et fragments pertinents que la simple accumulation de documents
- Un projet GitHub comprend README, arborescence de répertoires, multiples fichiers
Questionnement sur la forme du jeu de données Q/A
- Une requête du type « crée une carte » ne se résout pas forcément par un seul extrait de code ; elle implique l’analyse de la structure du projet, la vérification des assets, l’examen du style de code existant, la révision de la syntaxe Godot 4, la décision des fichiers à modifier, etc.
- Ainsi, il faut se demander si le dataset d’instructions doit contenir uniquement le code final ou également les étapes d’exploration et de décision
Anticipation d’un regain de poids Python lors du traitement par chunks
- Même en demandant « crée une carte avec Godot 4 », le modèle pourrait, lors de la lecture chunk par chunk, faire ressortir les poids pré‑entraînés sur Python
- Il faut donc injecter fortement le contexte Godot 4 en tête de prompt et filtrer rigoureusement les réponses contenant du code Godot 3 ou des réponses de style Python lors du pré‑traitement des données
Synthèse du jour
- Le RAG ou le crawling ne sont pas des solutions en soi ; l’enjeu principal est de concevoir comment le modèle lit le contexte et prend ses décisions
- On prévoit de découper le contexte du projet selon fichiers/rôles/dépendances et d’inclure, le cas échéant, non seulement la réponse finale mais aussi le flux d’exploration et de jugement dans les données d’instruction
- Il sera nécessaire de renforcer la conception des prompts, des tags, du filtrage et des critères de données préférées afin que le contexte Godot 4 ne soit pas dilué pendant le raisonnement
Rétrospective de développement : docs/retrospectives/2026-06-14.md