idea_world_labDEV JOURNAL
2026年7月21日星期二

2026 年 7 月 21 日

  • 使用 Markdown → JSONL Converter 将官方文档 JSONL 转换的收集量从 1,550 条推进至 1,422 条
  • 继续执行 Qwen Validation Debugger 的第 46 至 50 项,检查生成代码、Godot 3/4 引擎以及 JSONL 验证结果
  • 第 50 条调试日志输出项已完成公共代码和 JSONL 验证, 第 48 场景资源动态加载因模型不存在而生成固定资源路径,导致引擎检查持续被拒绝
  • 重试时传递前一次的引擎诊断,未在各项中直接注册语法或答案,而是让调试器在每轮生成时使用不同的稳定 seed
  • 将 8501 收集器当前的 JSONL 写入 outputs/godot-rag-sqlite/godot-rag.sqlite3,并对比 pages.zip 中的 1,570 条原文 URL·域名·SHA-256 与记录来源
  • 在 SQLite 中构建 docs_chunksapi_mappinglabel_prototypes、原文 provenance 与 FTS5 搜索索引,即使整体收集未完成,也能使用同一构建器重新生成快照
  • 将收集的 JSONL 与 SQLite、向量 DB 转储进行比较后,以保持原始记录和 provenance 不变、且无需额外服务器即可再生成·共享的 SQLite 形式提交到 Git
  • 起初仅将 SQLite 作为提交到 Git 的基准产出,且 Source Flow Debugger 的 F 策略继续使用 PostgreSQL,导致同一 JSONL 必须分别映射到 SQLite 与 PostgreSQL,出现一致性问题
  • 为消除双重管理,将 F 策略的基准数据与执行仓库合并为唯一提交的 SQLite,并移除 PostgreSQL 的连接设置与迁移路径
  • BM25 候选在 SQLite FTS5 中读取后,由 Node 计算 Okapi BM25,embedding 则与模型·维度·记录内容 SHA-256 和 Float32 向量一起存入同一 SQLite 的 record_embeddings,仅对变更的记录重新建立索引
  • Source Flow Debugger 在无额外 DB URL 的情况下直接检查提交的 SQLite 的修订、记录数和 embedding 数量,存储的向量由 Node 通过余弦相似度进行检索
  • 向量 DB 转储依赖于 embedding 模型、维度和索引实现,故不设为独立基准数据,而是需要时在同一 SQLite 中重新生成的派生索引加以区分