Modelado de tópicos en textos cortos e informales: adaptación y evaluación para el español argentino.

Cargando...
Miniatura
Fecha
2026-01-01
Título de la revista
ISSN de la revista
Título del volumen
Editor
Universidad Autónoma de Entre Ríos. Facultad de Ciencia y Tecnología
Resumen
El modelado de tópicos es una técnica de procesamiento de lenguaje natural que permite descubrir temas relevantes en grandes volúmenes de texto. Sin embargo, aplicarlo a textos cortos e informales en español argentino, como los que circulan en redes sociales, presenta desafíos particulares por las características propias del idioma y el alto nivel de ruido textual. El presente trabajo aborda estos desafíos comparando modelos de modela- do de tópicos específicamente adaptados para este contexto. Primeramente, se realizó la validación en el idioma inglés usando el entorno OCTIS conjuntamente con BERTopic, plan- teada por el autor. Luego, se llevó a cabo una comparativa en español argentino, analizando publicaciones de redes sociales de la República Argentina. Finalmente, se evaluaron tres modelos: Latent Dirichlet Allocation (LDA), Non-negative Matrix Factorization (NMF) y BER- Topic usando métricas de coherencia y diversidad, destacando sus ventajas y limitaciones para este tipo de datos. A partir de la evaluación realizada, se propone una metodología para el preprocesa- miento y modelado de tópicos adecuada para las particularidades del español argentino en textos cortos e informales.
Descripción
Palabras clave
Modelado de tópicos, Español argentino, BERTopic, LDA, NMF
Citación