Abstract
Le filtrage de contenus illicites sur Internet est une problématique difficile qui est actuellement résolue par des approches à base de listes noires et de mots-clés. Les systèmes de classification textuelle par apprentissage automatique nécessitant peu d’interventions humaines, elles peuvent avantageusement remplacer ou compléter les méthodes précédentes pour faciliter les mises à jour. Ces techniques, traditionnellement utilisées avec des catégories définies par leur sujet (économie ou sport par exemple), sont fondées sur la présence ou l’absence de mots. Nous présentons une évaluation de ces techniques pour le filtrage de contenus racistes. Contrairement aux cas traditionnels, les documents ne doivent pas être catégorisés suivant leur sujet mais suivant le point de vue énoncé (raciste ou antiraciste). Nos résultats montrent que les classifieurs, essentiellement lexicaux, sont néanmoins bien adaptées : plus de 90% des documents sont correctement classés, voir même 99% si l’on accepte une classe de rejet (avec 20% d’exemples non classés).- Anthology ID:
- 2003.jeptalnrecital-long.26
- Volume:
- Actes de la 10ème conférence sur le Traitement Automatique des Langues Naturelles. Articles longs
- Month:
- June
- Year:
- 2003
- Address:
- Batz-sur-Mer, France
- Editors:
- Béatrice Daille, Emmanuel Morin
- Venue:
- JEP/TALN/RECITAL
- SIG:
- Publisher:
- ATALA
- Note:
- Pages:
- 275–284
- Language:
- French
- URL:
- https://aclanthology.org/2003.jeptalnrecital-long.26
- DOI:
- Cite (ACL):
- Romain Vinot, Natalia Grabar, and Mathieu Valette. 2003. Application d’algorithmes de classification automatique pour la détection des contenus racistes sur l’Internet. In Actes de la 10ème conférence sur le Traitement Automatique des Langues Naturelles. Articles longs, pages 275–284, Batz-sur-Mer, France. ATALA.
- Cite (Informal):
- Application d’algorithmes de classification automatique pour la détection des contenus racistes sur l’Internet (Vinot et al., JEP/TALN/RECITAL 2003)
- PDF:
- https://preview.aclanthology.org/ingest-2024-clasp/2003.jeptalnrecital-long.26.pdf