2026年7月21日星期二2026年7月21日
- 使用 Markdown → JSONL Converter 将官方文档的 JSONL 转换收集量从 1,550 条推进到 1,422 条
- 从第 46 条到第 50 条继续运行
Qwen Validation Debugger,并检查生成的代码、Godot 3/4 引擎检查以及 JSONL 验证结果
- 第 50 条调试日志输出项已完成公共代码和 JSONL 验证,第 48 条场景资源动态加载因模型不存在而生成固定资源路径,导致引擎检查持续被拒绝
- 重试时传递前一次的引擎诊断,不在每个项目中手动注册语法或答案,而是让调试器在每轮生成时使用不同的稳定 seed
- 将 8501 收集器当前的 JSONL 写入
outputs/godot-rag-sqlite/godot-rag.sqlite3,并对比 pages.zip 中的 1,570 条原文 URL·域名·SHA-256 与记录来源
- 在 SQLite 中构建
docs_chunks、api_mapping、label_prototypes、原文 provenance 与 FTS5 搜索索引,即使在全部收集完成前也能使用相同构建器重新生成快照
- 将收集的 JSONL 以可上传至 Git 的形式比较 SQLite 与向量 DB 转储后,保留原始记录和 provenance,选择无需额外服务器即可重新生成·共享的 SQLite
- 起初仅将 SQLite 作为上传至 Git 的基准产出,并让 Source Flow Debugger 的 F 策略继续使用 PostgreSQL,导致同一 JSONL 必须分别映射到 SQLite 与 PostgreSQL,出现一致性问题
- 为消除双重管理,将 F 策略的基准数据和执行仓库合并为唯一提交的 SQLite,去除 PostgreSQL 连接设置和迁移路径
- BM25 候选在 SQLite FTS5 中读取后,在 Node 中使用 Okapi BM25 计算,embedding 存储在同一 SQLite 的
record_embeddings 中,包含模型·维度·记录内容 SHA-256 与 Float32 向量,仅对变更的记录重新索引
- Source Flow Debugger 在没有单独 DB URL 的情况下直接检查提交的 SQLite 的修订、记录数和 embedding 数量,存储的向量在 Node 中通过余弦相似度搜索
- 向量 DB 转储依赖于 embedding 模型、维度和索引实现,因此不作为单独的基准数据,而是需要时在同一 SQLite 中重新生成的派生索引进行区分