Decidimos pensar en criterios de defensa para evitar la recolección de datos maliciosos durante el proceso de recopilación
Dado que el código o la documentación generados por IA pueden contener caracteres ASCII modificados, caracteres Unicode confusos, caracteres de control invisibles, cadenas ofuscadas, etc., debemos considerar cómo detectarlos y normalizarlos en la fase de recolección
Concluí que, antes de simplemente acumular muchos datos de GitHub, es crucial establecer primero criterios para filtrar datos maliciosos, contaminados o ofuscados
Por problemas de condición, el trabajo podría retrasarse un poco temporalmente