idea_world_labDEV JOURNAL
sábado, 20 de junio de 2026

20 de junio de 2026

  • Decidimos pensar en criterios de defensa para evitar la recolección de datos maliciosos durante el proceso de recopilación
    • Dado que el código o la documentación generados por IA pueden contener caracteres ASCII modificados, caracteres Unicode confusos, caracteres de control invisibles, cadenas ofuscadas, etc., debemos considerar cómo detectarlos y normalizarlos en la fase de recolección
    • Concluí que, antes de simplemente acumular muchos datos de GitHub, es crucial establecer primero criterios para filtrar datos maliciosos, contaminados o ofuscados
  • Por problemas de condición, el trabajo podría retrasarse un poco temporalmente