idea_world_labDEV JOURNAL
terça-feira, 30 de junho de 2026

30 de junho de 2026

  • Como era temporada da Copa do Mundo, passei muito tempo assistindo e não consegui dormir bem, então não trabalhei muito
  • A conversão de Markdown → JSONL em localhost:8501 está atualmente em torno de 655 itens
  • Hoje foquei em criar e refinar rapidamente uma ferramenta de depuração de testes de validação, em vez de grandes coletas/treinamentos
  • Definimos a estratégia da ferramenta de depuração de testes de validação e implementamos a ferramenta web separada Qwen Validation Debugger
    • O caminho de execução é tools/qwen-validation-debugger
    • O comando local é npm run validation-debug:debug
    • O endereço padrão é http://127.0.0.1:8520/
  • Em 28 de junho, criamos manualmente chunks de código Godot e JSONL com o chatbot Qwen e fizemos a validação “sim”/“não” à mão
    • Esse método provou ser viável, mas à medida que os itens aumentam, a cópia/colagem e a comparação de resultados se tornam excessivas
    • Especialmente, precisamos testar as três tabelas docs_chunks, api_mapping e label_prototypes; se for sintaxe comum são necessárias 6 slots, se houver separação por versão, 12 slots, tornando a gestão manual rapidamente complexa
  • A ferramenta carrega 50 itens de teste Godot como amostra e faz o Qwen rotular primeiro se cada item é sintaxe comum ou separação Godot 3/4
    • Se for sintaxe comum, gera um código comum
    • Se houver diferença de versão, gera código Godot 3 e código Godot 4 separadamente
    • Depois, compõe automaticamente os slots JSONL por tabela
  • Confirmamos novamente que não podemos agrupar docs_chunks, api_mapping e label_prototypes apenas como “sim/não”
    • docs_chunks serve como base de explicação do código, então se corresponde ao código, a resposta é “sim”
    • api_mapping e label_prototypes são bases de migração; muitas vezes, códigos já aplicados ao Godot 4 ou sintaxe comum recebem “não”
    • Por isso, dividimos os nomes dos slots em Base de Explicação, Explicação Irrelevante, Necessita Conversão, Já Aplicado, Comum/Desnecessário, Conversão Irrelevante
  • O maior ajuste ao criar a ferramenta foi separar o Código Base de Geração JSONL do Código Alvo de Validação
    • Inicialmente, JSONL gerado a partir de código Godot 3 era validado apenas contra código Godot 3, e o de Godot 4 apenas contra código Godot 4
    • Mas, na prática, precisamos verificar se um JSONL baseado em Godot 3 gera “não” quando aplicado ao código Godot 4
    • Assim, adicionamos botões separados de Validação de Código Godot 3 e Validação de Código Godot 4 para cada slot, salvando os resultados individualmente
  • Depois de criar a ferramenta, a produtividade de desenvolvimento mudou bastante
    • Antes, era necessário solicitar ao Qwen o código e o JSONL a cada vez, inserir novamente no prompt, validar e comparar mentalmente a resposta esperada
    • Agora, seleção de itens, rotulação, geração de código, geração de JSONL, validação cruzada Godot 3/4 e visualização de prompt/resposta bruta acontecem em uma única tela
    • Em vez de apenas produzir rápido e muito, agora conseguimos rastrear claramente quais critérios foram usados e em quais códigos a validação ocorreu, evitando confusões
    • Ao repetir 50 itens de teste, o estado que a pessoa precisa lembrar diminui, permitindo identificar padrões de falha mais rapidamente
  • Com a ferramenta, podemos ver diretamente na tela quais prompts são enviados, a ordem de chamada para geração/validação em lote de JSONL e como os prompts de validação e de solicitação são estruturados
    • A resposta esperada é fixa conforme a rotulação e o tipo de slot, mantendo claro o critério “sim/não”
    • Os resultados são exibidos imediatamente por slot, facilitando a identificação rápida de combinações de código/JSONL que falharam
    • Mesmo quando a falha ocorre por causa do prompt, o prompt usado permanece na tela, facilitando ajustes posteriores
  • Como a ferramenta já está razoavelmente avançada, planejo reduzir o ritmo, focando em refinar lentamente os critérios de validação em vez de aumentar a quantidade de forma forçada
  • Documento de registro: Estratégia e Registro de Implementação do Qwen Validation Debugger
  • Retrospectiva: docs/retrospectives/2026-06-30.md