-
12
pages
-
Français
-
Documents
-
2011
Description
erTALN2011,Montpellier,27juin–1 juillet2011Générationautomatiquedemotifsdedétectiond’entitésnomméesenutilisantdescontenusencyclopédiques.1 1 1Eric Charton Michel Gagnon Benoit Ozell(1) École Polytechnique, 2900 boul. Edouard Montpetit, Montréal, Canada{eric.charton, michel.gagnon, benoit.ozell}@polymtl.caRésumé. Les encyclopédies numériques contiennent aujourd’hui de vastes inventaires deformes d’écritures pour des noms de personnes, de lieux, de produits ou d’organisation. Nousprésentons un système hybride de détection d’entités nommées qui combine un classifieur àbase de Champs Conditionnel Aléatoires avec un ensemble de motifs de détection extraits au-tomatiquement d’un contenu encyclopédique. Nous proposons d’extraire depuis des éditionsen plusieurs langues de l’encyclopédie Wikipédia de grandes quantités de formes d’écritureque nous utilisons en tant que motifs de détection des entités nommées. Nous décrivons uneméthode qui nous assure de ne conserver dans cette ressources que des formes non ambiguëssusceptibles de venir renforcer un système de détection d’entités nommées automatique. Nousprocédons à un ensemble d’expériences qui nous permettent de comparer un système d’étique-tage à base de CRF avec un système utilisant exclusivement des motifs de détection. Puis nousfusionnons les résultats des deux systèmes et montrons qu’un gain de performances est obtenugrâce à cette proposition.Abstract. Encyclopedic content can provide numerous samples of ...
-
Publié par
-
Publié le
24 juin 2011
-
Langue
Français