Черновики скриптов чанк‑и‑пост‑обработки и начальные наброски RAG‑чат/индекса также удалены
Папка work/godot_rag/ оставлена пустой, чтобы ошибочные артефакты не использовались как база
Зафиксировал причины в ретроспективе
Считаю, что проблема возникла из‑за того, что мы начали чанк‑инг до полного анализа структуры оригинальной документации
Цель собрать всю официальную документацию Godot превратилась в «MVP‑ядро API», выбранное ИИ произвольно, и в результате была добавлена жёсткая кодировка и избыточные детали, что привело к загрязнению
Отметил, что без моего указания ChatGPT/Codex сам сокращал область или предполагал готовый ответ до завершения шага, создавая последующие артефакты
Установил, что когда смешиваются генерации ИИ, варианты regex, ссылки на официальную документацию и пользовательские правила, их нельзя использовать в качестве основы для разметчика/RAG‑детектора
Перечислил текущие недостатки архитектуры
Слой статического анализа слаб
Отсутствует проверка на основе AST/парсера GDScript
Граф зависимостей проекта Godot недостаточно развит
Проверка выполнения и синтаксиса слабая
Таксономия меток ещё грубая
Трудно различать происхождение (provenance) генераций ИИ и проверенных ответов
Проектирование устранения утечек и дублирования данных слабое
Перенастроил направление дальнейшей работы на анализ оригинального godot_docs_full
Вместо немедленного восстановления RAG или каталога, сначала проанализируем содержимое outputs/godot_docs_full/pages
Нужно выяснить, как построены Markdown‑структуры в разделах class reference, migration и tutorial
На основе структуры официальной документации решим, какие единицы чанков использовать: по странице, по разделу или по отдельным API‑членам
Прежде чем чанк‑ить, следует определить критерии отчётов верификации