idea_world_labDEV JOURNAL
dimanche 14 juin 2026

14 juin 2026

  • Réflexion à bord du bus en direction de Séoul sur le dataset/RAG pipeline de Godot 4

    • Au départ, l’idée était de crawler la documentation officielle de Godot, de convertir les projets GitHub en formats md et jsonl, puis d’utiliser un chatbot RAG pour déterminer si le projet concernait Godot 3 ou 4
    • Mais il est devenu douteux de pouvoir placer l’ensemble du contexte du projet et les extraits de documentation officielle dans le même contexte d’entrée du modèle
  • Analyse des limites du contexte d’entrée d’un chatbot RAG

    • Un projet GitHub comprend README, arborescence de répertoires, multiples fichiers .gd, scènes, chemins de ressources, etc.
    • Ajouter les documents officiels récupérés par le RAG gonfle l’entrée, rendant plus crucial la sélection des fichiers et fragments pertinents que la simple accumulation de documents
  • Questionnement sur la forme du jeu de données Q/A

    • Une requête du type « crée une carte » ne se résout pas forcément par un seul extrait de code ; elle implique l’analyse de la structure du projet, la vérification des assets, l’examen du style de code existant, la révision de la syntaxe Godot 4, la décision des fichiers à modifier, etc.
    • Ainsi, il faut se demander si le dataset d’instructions doit contenir uniquement le code final ou également les étapes d’exploration et de décision
  • Anticipation d’un regain de poids Python lors du traitement par chunks

    • Même en demandant « crée une carte avec Godot 4 », le modèle pourrait, lors de la lecture chunk par chunk, faire ressortir les poids pré‑entraînés sur Python
    • Il faut donc injecter fortement le contexte Godot 4 en tête de prompt et filtrer rigoureusement les réponses contenant du code Godot 3 ou des réponses de style Python lors du pré‑traitement des données
  • Synthèse du jour

    • Le RAG ou le crawling ne sont pas des solutions en soi ; l’enjeu principal est de concevoir comment le modèle lit le contexte et prend ses décisions
    • On prévoit de découper le contexte du projet selon fichiers/rôles/dépendances et d’inclure, le cas échéant, non seulement la réponse finale mais aussi le flux d’exploration et de jugement dans les données d’instruction
    • Il sera nécessaire de renforcer la conception des prompts, des tags, du filtrage et des critères de données préférées afin que le contexte Godot 4 ne soit pas dilué pendant le raisonnement
  • Rétrospective de développement : docs/retrospectives/2026-06-14.md