Sentiment classification on arabic corpora

Le développement des médias sociaux (tels que les forums web en ligne et les sites de réseaux sociaux) a provoqué l’intérêt de fouiller et d’analyser les opinions disponibles sur le web. Ainsi, l’opinion en ligne est devenue l’objet d’étude dans plusieurs domaines de recherche ; en l’occurrence le d...

সম্পূর্ণ বিবরণ

সংরক্ষণ করুন:
গ্রন্থ-পঞ্জীর বিবরন
প্রধান লেখক: Mountassir, Asmaa, Benbrahim, Houda, Berrada, Ilham
বিন্যাস: Article ou chapitre numérique
ভাষা:Français
প্রকাশিত: 2013
বিষয়গুলি:
অনলাইন ব্যবহার করুন:Accès Université d'Orléans et IFPM
বিবরন
সংক্ষিপ্ত:Le développement des médias sociaux (tels que les forums web en ligne et les sites de réseaux sociaux) a provoqué l’intérêt de fouiller et d’analyser les opinions disponibles sur le web. Ainsi, l’opinion en ligne est devenue l’objet d’étude dans plusieurs domaines de recherche ; en l’occurrence le domaine dit « Opinion Mining and Sentiment Analysis ». Plusieurs travaux intéressants et avancés ont été menés dans peu de langues (notamment l’anglais). Les langues dites riches morphologiquement, comme l’arabe, ont développé très peu d’études. Le présent papier détaille l’étude que nous avons menée dans le but d’investiguer la classification supervisée de sentiment dans un contexte arabe. Nous avons utilisé deux corpus arabes différents à plusieurs niveaux. Nous avons utilisé trois classificateurs standard et connus pour leur efficacité, à savoir Naïve Bayes, Support Vector Machines et k-Nearest Neighbor. Nous investiguons un ensemble de settings pour identifier ceux permettant de donner les meilleurs résultats. Les settings ainsi étudiés concernent le type de racination, le seuillage de fréquence des termes, la pondération des termes et les n-grammes mots. Nous montrons que Naïve Bayes et Support Vector Machines sont efficaces et compétitifs. Néanmoins, la performance de k-Nearest Neighbor dépend du corpus. Nous recommandons, à travers cette étude, d’utiliser la pseudo-racination plutôt que la racination, de supprimer les termes apparaissant une seule fois, de combiner les unigrammes avec les bigrammes mots et d’utiliser une pondération à base de présence plutôt qu’une pondération à base de fréquence. Les résultats de notre étude montrent également que la performance de classification peut être influencée par la longueur et l’homogénéité des documents ainsi que par la nature des auteurs des documents. Par contre, la taille des corpus n’a pas d’impact sur les résultats de classification.