idea_world_labDEV JOURNAL
2026年6月20日土曜日

2026 年 6 月 20 日

  • データ収集過程で悪意あるデータを収集しないよう防御基準を検討することにした
    • AI が生成したコードや文書に ASCII 変形、Unicode 混同文字、見えない制御文字、難読化文字列などが含まれる可能性があるため、収集段階でどう検知・正規化するかを考える必要がある
    • 単に GitHub データを大量に集めるより、悪意/汚染/難読化データを除外する基準を先に設定することが重要だと整理した
  • コンディション問題で当面作業が少し遅れる可能性がある