Se añadió la configuración de PostgreSQL local para el clasificador RAG de la documentación oficial de Godot
Se documentó la ejecución de un contenedor pgvector/pgvector:pg16 mediante Docker Compose.
La columna de payload de la base de datos se alineó con los nombres de campo de docs_chunks.jsonl, api_mapping.jsonl y label_prototypes.jsonl.
Se definieron las tablas docs_chunks, api_mapping, label_prototypes, ingest_reports y los índices para búsquedas por keyword/exact.
La columna de embedding se dejó abierta; el índice vectorial real se creará en una migración posterior, una vez se confirme la dimensión del modelo de embeddings.
Se registró una retrospectiva del proceso de conversión de Markdown a JSONL y la preparación para la inserción en la base de datos local
En lugar de cargar directamente el Markdown oficial en la base de datos, se convierte a un artefacto intermedio JSONL para previsualizar y validar.
Se explicó por qué los resultados se dividen en docs_chunks, api_mapping y label_prototypes, y se estructuraron de forma que resulten fáciles de insertar en PostgreSQL local.
Se documentó la razón por la que el repositorio se hizo público y luego se volvió privado, y se reflexionó sobre la publicación
Aunque la inseguridad sobre el propio nivel de habilidad hizo que la publicación fuera intimidante, se consideró que compartir el registro puede servir de base para otros y acelerar el propio crecimiento.
También se describió el plan de desplegar un endpoint LLM local en un entorno Oracle Cloud de 24 GB VRAM para automatizar flujos de trabajo y revisiones de PR en GitHub.
Debido a la pérdida de la cuenta de Oracle Cloud y a la complejidad de la configuración de RunPod, la automatización de revisiones de PR basada en LLM se pospondrá para más adelante.
Las tareas restantes para hoy se centraron en convertir aproximadamente 1 500 archivos Markdown de la documentación oficial a JSONL y cargarlos en la base de datos local
La conversión de un solo archivo lleva más tiempo de lo esperado, por lo que no está claro si se podrán terminar los 1 500 en el día.
Según los registros actuales, en aproximadamente 1 hora 9 min se procesaron 39 archivos done + 4 deferred, totalizando 43 archivos.
La velocidad promedio es de ~1,6 min por archivo; se estima que convertir los 1 570 archivos requerirá alrededor de 42 horas de cómputo.
Se planificó la validación que se realizará mañana y pasado mañana, ya que es probable que no haya tiempo disponible esos días
Se inyectará el JSONL ya generado en PostgreSQL local y se verificará que sea searchable.