idea_world_labDEV JOURNAL
2026년 7월 21일 화요일

2026 년 7 월 21 일

  • Markdown -> JSONL Converter로 공식문서 JSONL 변환 수집량을 1,550개 중 1,422개까지 진행함
  • Qwen Validation Debugger의 46번부터 50번까지 이어서 실행하고 생성 코드, Godot 3/4 엔진 검사와 JSONL 검증 결과를 확인함
  • 50번 디버깅 로그 출력 항목은 공통 코드와 JSONL 검증을 완료했고, 48번 씬 리소스 동적 로딩은 모델이 존재하지 않는 고정 리소스 경로를 생성해 엔진 검사에서 계속 거부됨
  • 재시도할 때 직전 엔진 진단을 전달하고, 항목별 문법이나 정답을 직접 등록하지 않은 채 생성 라운드마다 다른 안정적 seed를 사용하도록 디버거를 개선함
  • 8501 수집기의 현재 JSONL을 outputs/godot-rag-sqlite/godot-rag.sqlite3로 적재하고, pages.zip의 1,570개 원문 URL·도메인·SHA-256과 레코드 출처를 대조함
  • SQLite에 docs_chunks, api_mapping, label_prototypes, 원문 provenance와 FTS5 검색 인덱스를 구성하고, 전체 수집이 끝나기 전에도 같은 빌더로 스냅샷을 다시 만들 수 있게 함
  • 수집된 JSONL을 Git에 올릴 형식으로 SQLite와 벡터 DB 덤프를 비교한 뒤, 원본 레코드와 provenance를 그대로 보존하고 별도 서버 없이 재생성·공유할 수 있는 SQLite를 선택함
  • 처음에는 SQLite를 Git에 올리는 기준 산출물로만 추가하고 Source Flow Debugger의 F 전략은 PostgreSQL을 계속 보게 두어, 같은 JSONL을 SQLite와 PostgreSQL에 따로 반영해야 하는 정합성 문제가 생김
  • 이중 관리를 없애기 위해 F 전략의 기준 데이터와 실행 저장소를 커밋된 SQLite 하나로 통합하고, PostgreSQL 접속 설정과 마이그레이션 경로를 제거함
  • BM25 후보는 SQLite FTS5에서 읽은 뒤 Node에서 Okapi BM25로 계산하고, embedding은 같은 SQLite의 record_embeddings에 모델·차원·레코드 내용 SHA-256과 Float32 벡터를 함께 저장해 변경된 레코드만 다시 인덱싱하도록 바꿈
  • Source Flow Debugger가 별도 DB URL 없이 커밋된 SQLite의 리비전, 레코드 수와 임베딩 수를 직접 확인하고, 저장된 벡터는 Node에서 cosine similarity로 검색하도록 연결함
  • 벡터 DB 덤프는 embedding 모델, 차원과 인덱스 구현에 종속되므로 별도 기준 데이터로 두지 않고, 필요하면 같은 SQLite에서 다시 생성하는 파생 인덱스로 구분함