Ajout de la configuration locale PostgreSQL pour le classificateur RAG de la documentation officielle de Godot
Mise en place d’un conteneur pgvector/pgvector:pg16 via Docker Compose.
Les colonnes de charge utile de la base de données sont alignées avec les champs de docs_chunks.jsonl, api_mapping.jsonl et label_prototypes.jsonl.
Définition des tables docs_chunks, api_mapping, label_prototypes, ingest_reports ainsi que des index pour la recherche par mot‑clé/exacte.
La colonne d’embedding reste vide ; l’index vectoriel réel sera créé après la confirmation des dimensions du modèle d’embedding, via une migration séparée.
Rétrospective du processus de conversion Markdown → JSONL et de l’injection dans la DB locale
Au lieu d’insérer directement le Markdown de la documentation officielle dans la DB, on le convertit d’abord en JSONL intermédiaire pour prévisualiser et valider.
Le résultat de la conversion est réparti entre docs_chunks, api_mapping et label_prototypes, ce qui facilite l’insertion dans PostgreSQL local.
Récit des raisons pour lesquelles le dépôt a d’abord été rendu public puis rendu privé, et réflexion sur la publication
L’insécurité quant à mon niveau actuel rendait la publication stressante, mais partager les notes peut aider d’autres personnes et accélérer ma propre progression.
J’avais prévu de déployer un endpoint LLM local sur une instance Oracle Cloud 24 GB VRAM pour automatiser les revues PR via les workflows GitHub, mais la perte du compte Oracle Cloud et la complexité de la configuration RunPod ont conduit à reporter cette automatisation à plus tard.
Travail restant aujourd’hui : convertir environ 1 500 fichiers Markdown de la documentation officielle en JSONL et les charger dans la DB locale
La conversion d’un fichier prend plus de temps que prévu, donc il n’est pas certain de finir les 1 500 aujourd’hui.
Au moment du journal, environ 1 h 09 min ont permis de traiter 39 fichiers done + 4 deferred, soit 43 fichiers au total.
La vitesse moyenne est d’environ 1,6 min par fichier, ce qui donne une estimation de ~42 heures pour convertir les 1 570 fichiers.
Prévisions pour demain et après‑demain (probablement pas de temps disponible) : plan de validation
Injecter les JSONL déjà générés dans PostgreSQL local et vérifier la recherchabilité.