idea_world_labDEV JOURNAL
2026年6月22日星期一

2026 年 6 月 22 日

  • 为 Godot 官方文档 RAG 分类器添加了本地 PostgreSQL 设置
    • 基于 Docker Compose 整理了运行 pgvector/pgvector:pg16 容器的方案。
    • DB payload 列与 docs_chunks.jsonlapi_mapping.jsonllabel_prototypes.jsonl 的字段名保持一致。
    • 定义了 docs_chunksapi_mappinglabel_prototypesingest_reports 表及用于 keyword/exact 搜索的索引。
    • embedding 列保留,实际的向量索引将在确定嵌入模型维度后通过单独 migration 创建。
    • DB 设置文档: docs/database/2026-06-22-local-postgres-setup.md
  • 记录了 Markdown → JSONL 转换器与本地 DB 注入准备过程的回顾
    • 将官方文档 Markdown 先转换为 JSONL 中间产物,再进行预览/验证,而不是直接写入 DB。
    • 将转换结果分别归入 docs_chunksapi_mappinglabel_prototypes,并以便于本地 PostgreSQL 导入的结构保存。
    • 回顾: docs/retrospectives/2026-06-22.md
  • 回顾了将仓库公开后又改为私有的原因以及对公开的思考
    • 由于对当前能力的不安,公开有压力,但认为共享记录能为他人提供垫脚石,也能提升自己的成长速度。
    • 计划在 Oracle Cloud 24GB VRAM 环境下部署本地 LLM endpoint,以接入 GitHub workflow/PR 评审自动化。
    • 由于 Oracle Cloud 账户丢失以及 RunPod 设置繁琐,决定将基于 LLM 的 PR 评审自动化留待以后再实现。
  • 今日剩余工作决定集中在将约 1,500 篇官方文档 Markdown 转换为 JSONL 并导入本地 DB
    • 单个文件转换耗时超预期,尚不确定能否在今天完成全部 1,500 篇。
    • 依据当前日志,约 1 小时 9 分钟内处理了 done 39 个 + deferred 4 个,共计 43 个文件。
    • 平均速度约为每文件 1.6 分钟,预计全部 1,570 个文件约需 42 小时。
  • 明日及后天时间可能不足,整理了后续验证计划
    • 将已生成的 JSONL 注入本地 PostgreSQL,检查是否可检索。
    • 按照 docs/roadmaps/2026-06-21-initial-rag-classifier-architecture.md 的工作流,在 Python 脚本中小规模验证 source code → AST Parser → Retriever → evidence JSONL → Qwen 3.6 API 调用链路。
    • 计划间歇性检查 Qwen 3.6 基于 Retriever 依据的响应情况。