Решили разработать критерии защиты от сбора вредоносных данных
Поскольку генерируемый ИИ код и документы могут содержать изменённые ASCII‑символы, похожие Unicode‑символы, невидимые управляющие символы и обфусцированные строки, необходимо продумать, как их обнаруживать и нормализовать уже на этапе сбора
Считаю более важным сначала установить правила фильтрации вредоносных/загрязнённых/обфусцированных данных, чем просто собирать как можно больше данных с GitHub
Из‑за проблем с условиями работы некоторые задачи могут быть отложены