Como era temporada da Copa do Mundo, passei muito tempo assistindo e não consegui dormir bem, então não trabalhei muito
A conversão de Markdown → JSONL em localhost:8501 está atualmente em torno de 655 itens
Hoje foquei em criar e refinar rapidamente uma ferramenta de depuração de testes de validação, em vez de grandes coletas/treinamentos
Definimos a estratégia da ferramenta de depuração de testes de validação e implementamos a ferramenta web separada Qwen Validation Debugger
O caminho de execução é tools/qwen-validation-debugger
O comando local é npm run validation-debug:debug
O endereço padrão é http://127.0.0.1:8520/
Em 28 de junho, criamos manualmente chunks de código Godot e JSONL com o chatbot Qwen e fizemos a validação “sim”/“não” à mão
Esse método provou ser viável, mas à medida que os itens aumentam, a cópia/colagem e a comparação de resultados se tornam excessivas
Especialmente, precisamos testar as três tabelas docs_chunks, api_mapping e label_prototypes; se for sintaxe comum são necessárias 6 slots, se houver separação por versão, 12 slots, tornando a gestão manual rapidamente complexa
A ferramenta carrega 50 itens de teste Godot como amostra e faz o Qwen rotular primeiro se cada item é sintaxe comum ou separação Godot 3/4
Se for sintaxe comum, gera um código comum
Se houver diferença de versão, gera código Godot 3 e código Godot 4 separadamente
Depois, compõe automaticamente os slots JSONL por tabela
Confirmamos novamente que não podemos agrupar docs_chunks, api_mapping e label_prototypes apenas como “sim/não”
docs_chunks serve como base de explicação do código, então se corresponde ao código, a resposta é “sim”
api_mapping e label_prototypes são bases de migração; muitas vezes, códigos já aplicados ao Godot 4 ou sintaxe comum recebem “não”
Por isso, dividimos os nomes dos slots em Base de Explicação, Explicação Irrelevante, Necessita Conversão, Já Aplicado, Comum/Desnecessário, Conversão Irrelevante
O maior ajuste ao criar a ferramenta foi separar o Código Base de Geração JSONL do Código Alvo de Validação
Inicialmente, JSONL gerado a partir de código Godot 3 era validado apenas contra código Godot 3, e o de Godot 4 apenas contra código Godot 4
Mas, na prática, precisamos verificar se um JSONL baseado em Godot 3 gera “não” quando aplicado ao código Godot 4
Assim, adicionamos botões separados de Validação de Código Godot 3 e Validação de Código Godot 4 para cada slot, salvando os resultados individualmente
Depois de criar a ferramenta, a produtividade de desenvolvimento mudou bastante
Antes, era necessário solicitar ao Qwen o código e o JSONL a cada vez, inserir novamente no prompt, validar e comparar mentalmente a resposta esperada
Agora, seleção de itens, rotulação, geração de código, geração de JSONL, validação cruzada Godot 3/4 e visualização de prompt/resposta bruta acontecem em uma única tela
Em vez de apenas produzir rápido e muito, agora conseguimos rastrear claramente quais critérios foram usados e em quais códigos a validação ocorreu, evitando confusões
Ao repetir 50 itens de teste, o estado que a pessoa precisa lembrar diminui, permitindo identificar padrões de falha mais rapidamente
Com a ferramenta, podemos ver diretamente na tela quais prompts são enviados, a ordem de chamada para geração/validação em lote de JSONL e como os prompts de validação e de solicitação são estruturados
A resposta esperada é fixa conforme a rotulação e o tipo de slot, mantendo claro o critério “sim/não”
Os resultados são exibidos imediatamente por slot, facilitando a identificação rápida de combinações de código/JSONL que falharam
Mesmo quando a falha ocorre por causa do prompt, o prompt usado permanece na tela, facilitando ajustes posteriores
Como a ferramenta já está razoavelmente avançada, planejo reduzir o ritmo, focando em refinar lentamente os critérios de validação em vez de aumentar a quantidade de forma forçada