idea_world_labDEV JOURNAL
2026年7月21日星期二

2026 年 7 月 21 日

  • 使用 Markdown → JSONL Converter 将官方文档 JSONL 转换收集量从 1,550 条提升至 1,422 条
  • 继续执行 Qwen Validation Debugger 的第 46 至 50 项,检查生成代码、Godot 3/4 引擎以及 JSONL 验证结果
  • 第 50 条调试日志输出项已完成公共代码和 JSONL 验证, 第 48 条场景资源动态加载因模型不存在而生成固定资源路径,导致引擎检查持续被拒绝
  • 重试时传递前一次引擎诊断,并改进调试器,使每轮生成使用不同的稳定 seed,而无需手动注册每项语法或答案
  • 将 8501 收集器当前的 JSONL 加载至 outputs/godot-rag-sqlite/godot-rag.sqlite3,并对比 pages.zip 中的 1,570 条原文 URL·域名·SHA‑256 与记录来源
  • 在 SQLite 中构建 docs_chunksapi_mappinglabel_prototypes、原文 provenance 与 FTS5 搜索索引,并在全部收集完成前也能使用同一构建器重新生成快照
  • 将收集的 JSONL 与 SQLite、向量 DB 转储进行比较后,以保留原始记录和 provenance 的形式提交至 Git,并选择无需额外服务器即可重新生成·共享的 SQLite
  • 起初仅将 SQLite 作为提交至 Git 的基准产出,Source Flow Debugger 的 F 策略仍持续使用 PostgreSQL,导致同一 JSONL 需要分别映射到 SQLite 与 PostgreSQL,出现一致性问题
  • 为消除双重管理,将 F 策略的基准数据和执行仓库统一为提交的单一 SQLite,去除 PostgreSQL 的连接设置和迁移路径
  • BM25 候选在 SQLite FTS5 中读取后于 Node 上使用 Okapi BM25 计算,embedding 则与同一 SQLite 的 record_embeddings 中的模型·维度·记录内容 SHA‑256 与 Float32 向量一起存储,仅对变更的记录重新建立索引
  • Source Flow Debugger 在无额外 DB URL 的情况下直接检查提交的 SQLite 的修订、记录数和 embedding 数量,存储的向量在 Node 上通过余弦相似度进行搜索
  • 向量 DB 转储依赖于 embedding 模型、维度和索引实现,故不设为独立基准数据,必要时可在同一 SQLite 中重新生成作为派生索引