idea_world_labDEV JOURNAL

Topics

Observation

16 entries

2026-07-28 Source Flow Debugger 实际源码搜索报告2026-07-28 · 目的 在已有记录中,仅写到实际的 Godot 项目被划分为 134 个块进行搜索,且相关文档出现在上位结果中。仅凭这一描述,无法得知每个块返回了什么,返回的 JSONL 是否真的存在于 SQLite 中,或者更直接的文档是否因为排名被压制而未被检出。 本报告将以下三个问题分开记录。 Source Flo...Qwen Validation Debugger 合成数据 E2E 合约2026-07-15 · 编写日期:2026年 7月 15日 文档目的 Qwen Validation Debugger 是在运营用 Retriever 和验证器完成之前,用合成数据测试整体流程的工具。 针对一个测试主题,生成 Godot 3 代码和 Godot 4 代码,并为这些代码生成匹配的 JSONL 和不匹配的 JSON...Qwen Validation Debugger 提示应用结构2026-07-13 · 创建日期:2026年7月13日 文档目的 本文档整理了实际应用于 tools/qwen-validation-debugger 的 Prompt。 仅记录代码在何处生成 Prompt、向哪个 API 发送、以及期望的响应格式,不添加解释。 目标文件 文件 本文档中展示的内容 --- --- tools/...Qwen Godot 代码 JSONL 依据匹配测试检查清单2026-06-28 · 编写日期:2026年 6月 28日 目的 使用 Qwen 生成 50 个 Godot 3 代码块,并以与昨天进行的 JSONL 依据匹配测试相同的方式,检查 是/否 判定是否正确。 本次测试并不是要判断模型是否了解 Godot 知识。它是一个在同时提供 SOURCE CODE 和 JSONL 时,判断...Qwen 测试用 JSONL 架构与用途2026-06-28 · 编写日期:2026年 6月 28日 目的 使用 Qwen 创建 Godot 代码块,并在该代码块上附加正确的 JSONL 与错误的 JSONL,以进行 “是”/“否” 验证时,整理参考的 JSONL 格式以及每个 JSONL 的用途。 本文档不是提供示例数据的文档。它是用于在测试时确认哪些 JSONL...Retriever 检索 替代 方案 拆解 文档2026-06-28 · 编写日期:2026年 6月 28日 此目录是为了更易阅读而重新划分的文档集合,来源于 Retriever 检索 替代 ChatGPT 原文 备注。 原文备注保持原样。此 README 汇总了共同上下文、当前方式、模型候选、选择指南。子文档仅包含各替代方案的文档。 综合比较表 这些表格并非最终选择,而是...从结论开始2026-06-28 · 是的。我把意图弄错了。 准确地重新把握的话就是这个。 还有一个重要的修改。 当前项目的 /api/retrieve 不是 BM25。 当前代码是: 这是。PostgreSQL 的 ts rank cd 是全文检索排名函数,而不是 BM25 本身。PostgreSQL 文档也说明 ts rank/ts r...备选方案 E:创建 Qwen 查询配置文件2026-06-28 · 流程 示例输出 如果 Qwen 表现良好,可以像下面这样创建搜索 profile。 优点 可以减少硬编码。 可以在复杂的块中概括意图。 可以让搜索词更易于人阅读。 可以将 Godot 上下文推理交给 Qwen。 缺点 速度慢。 成本高。 从搜索前阶段起就可能出现幻觉。 可能会产生没有 Qwen 的线索。...方案 A:保持当前 PostgreSQL 全文检索2026-06-28 · 流程 优点 已经实现。 只需要 PostgreSQL 即可。 基础设施简单。 可以直接匹配已有 search tsv 的表。 缺点 不是 BM25。 对长代码块不友好。 plainto tsquery 生成的条件可能过于严格。 代码标记噪声较多。 不能进行语义搜索。 即使 chunk 的划分稍有不同,也...方案 B:仅使用 BM252026-06-28 · 流程 BM25所看到的 BM25大致通过以下要素来计算得分。 所以基准块的后续单词变得重要。 在基准块中成功的原因 在原始笔记的模拟中,以下文档会出现在上方。 直接匹配的令牌如下。 特别是以下标记在语料库中较为罕见,因此对得分贡献很大。 失败候选 在 BM25 only 中,也可能出现 3D movem...方案 C:仅嵌入2026-06-28 · 流程 为什么需要 embedding BM25 对精确字符串很强,但如果说明文字和代码表示不同,效果可能会变差。 例如,chunk 中包含以下代码。 文档中可能会有如下说明。 在这种情况下,embedding 可以捕获语义关联。 在基准块中预期的成功 embedding 有可能找到以下主题。 基准块中预...替代方案 D:BM25 + 嵌入 并行2026-06-28 · 流程 角色分配 BM25 捕获的内容: embedding捕获的内容: Qwen direct-evidence validator的作用: 优点 字符串搜索和语义搜索的弱点相互补足。 即使没有 Qwen,第一轮候选的质量也会提升。 保持 raw chunk 条件。 即使没有硬编码的 Godot API...替代方案 F:BM25 + 嵌入 + 重排序器 + 验证器2026-06-28 · 流程 角色分配 BM25: 代码嵌入: reranker: Qwen direct-evidence validator: 基准块中的预期排序 应上升的候选: 需要降低的候选项: PoC 模拟 假设将基准块放入最终推荐流程中。 1阶段:BM25 候选 BM25 将获取的候选: 2阶段:embedding...JSONL 依据匹配 提示 观察2026-06-27 · 编写日期:2026年 6月 27日 目的 今天在 Source Flow Debugger 中实际连接数据库搜索之前,让 GPT 生成用于演示的 Godot 代码块和 JSONL 候选项,并检查 LLM 是否能够依据这些 JSONL 正确判断相关/无关。 但是实际上,仅凭这个问题仍然不足。LLM 并不是...基于 JSONL 收集现状的测试仓库选择观察日志2026-06-27 · 编写日期:2026 年 6 月 27 日 目的 根据迄今为止生成的 JSONL,判断先克隆哪种性质的 Godot 仓库进行测试更为合适。 这里的目标并不是“随便挑选一个著名的仓库”。首先要看当前数据库中累积的依据在什么领域较强,哪些领域仍然薄弱,然后选择 Retriever 实际能够找到依据的仓库性质。...2026-06-25 Qwen Markdown 分类 观察日志2026-06-25 · 编写日期: 2026年 6月 25日 目的 在 make md Web UI 中如何将 Markdown 文件传递给 Qwen 3.6,以及收到什么响应,基于实际调试状态进行记录。 API key 不会包含在请求 payload 中,也不会记录在本文档里。 观察时点状态 状态文件: /Users/joy...