NLP et écoute client : analyse de sentiment, topic modeling et classification des verbatims

Pourquoi exploiter les retours clients grâce au NLP ?

Le monde de l’entreprise connaît une multiplication des points de contact avec les clients. Chacun peut rédiger un avis, un post sur un réseau social, un ticket ou un email. Cette source d’information est extrêmement riche puisqu’elle contient les ressentis et les questionnements des clients. Cependant, ces données sont rarement suffisamment exploitées alors qu’elles pourraient permettre de mieux comprendre les points d’insatisfaction ou de questionnement des clients.

Qu’est-ce que le NLP (Natural Language Processing) ?

Le traitement automatique du langage dit naturel, appelé aussi Natural Language Processing (NLP) en anglais, est une technologie permettant à des machines d’analyser le langage humain grâce à l’intelligence artificielle (IA). L’ordinateur peut alors comprendre et synthétiser les retours clients.

Il existe de nombreuses techniques autour du NLP, telles que :

  • L’analyse de sentiment,
  • La traduction automatique
  • La détection de thèmes (nouveaux trends twitter, nouveaux sujets abordés dans les médias, trouver les différents aspects d’un produit abordés par des commentaires afin de pouvoir plus facilement l’améliorer à partir de feedbacks utilisateurs, …),
  • La classification de messages (exemple : spams),
  • La reconnaissance vocale,
  • Les assistants personnels tels que Apple Siri, Microsoft Cortana, Amazon Alexa,
  • Les chatbots,
  • La génération automatique de texte,

Nous ne nous focaliserons ici que sur les techniques de traitement de textes qui nous permettent de remplir notre objectif d’écoute des clients : l’analyse de sentiment,  la détection automatique de thèmes, appelée topic modeling, ou encore la classification de messages dans des thèmes.

L’analyse de sentiment : mesurer la satisfaction client grâce au NLP

Nlp-avisia

L’analyse de sentiment permet de connaître la satisfaction des clients et ainsi guider les stratégies commerciales. Mettre en place un monitoring de la satisfaction permet alors de la suivre dans le temps et d’en suivre les tendances :

  • Connaître l’évolution de l’avis des internautes sur la marque/les produits/les concurrents (moins coûteux que des enquêtes d’opinions !),
  • Identifier les influenceurs sur l’activité de la marque,
  • Identifier les sources de frustration.

Cette méthode peut aussi être utilisée pour segmenter la base des utilisateurs en plusieurs catégories et ainsi avoir une communication adaptée à chaque groupe ou prioriser les réponses à donner en urgence. Un message ayant un sentiment négatif peut provenir d’un client particulièrement insatisfait auquel il sera préférable de répondre rapidement.

Enfin, il peut aussi servir d’indicateur dans les prédictions, par exemple, avec le lancement d’un nouveau produit ou d’une nouvelle campagne marketing.

Comment préparer les données textuelles avant une analyse de sentiment ?

Du côté pratique, quel que soit le cas d’usage, les algorithmes de Data Science ne savent pas manipuler du texte brut. C’est pourquoi une étape de préparation des données est nécessaire. Le premier objectif de cette préparation est de réduire le nombre de mots pour ne conserver que ceux donnant son sens au message. Il est possible d’effectuer les étapes suivantes :

Nlp-1-avisia

Ces étapes sont courantes mais pas systématiques ! Tout dépend de votre objectif. Par exemple, pour détecter des spams, l’utilisation des majuscules donnera un signal important. Ensuite, habituellement, chaque texte est transformé en des vecteurs de mots qui mènent à créer une matrice document-terme qui sera l’entrée de l’analyse. Cela facilite l’usage de certains algorithmes qui ne prennent en entrée que des nombres.

Nlp-2-avisia

Quelles méthodes utiliser pour une analyse de sentiment ?

Côté méthodologie, plusieurs approches s’offrent à vous :

  • Approche par dictionnaire : il faut disposer d’un référentiel où chaque mot est associé à un score de sentiment. Le score d’un message est obtenu à partir des scores des mots qui le composent. L’avantage de cette méthode est qu’elle est simple à comprendre, à expliquer et à implémenter. Par contre, elle ne tient pas compte du contexte dans lequel le mot est employé et ne gère pas du tout les sarcasmes, l’ironie, etc.
  • Approche supervisée : entraîner un modèle de Machine Learning à différencier les messages positifs de ceux négatifs à partir de données labélisées. Exemples de modèles : SVM, régression logistique, XGBoost. L’utilisation de classification naïve bayésienne est aussi une approche supervisée possible. Elle calcule pour un message la probabilité de chaque classe de sentiment (positive, négative ou neutre) sachant les mots qui le composent. Ces méthodes sont souvent plus performantes que l’approche par dictionnaire mais sont un peu moins facilement explicables à des interlocuteurs métier. Elles nécessitent en outre un corpus de messages dont on connait déjà le sentiment.
  • Word Embedding : utiliser un réseau de neurones résumant un texte en un vecteur de nombres avant d’en prédire le sentiment. Ces vecteurs peuvent être pré-calculés et utilisés en entrée des modèles supervisés présentés juste avant, ou alors être découverts en entraînant un réseau de neurones adapté à la problématique. Cette méthode est très performante car c’est la méthode prenant le mieux en compte le contexte dans lequel le mot est utilisé. Cependant, comme tout réseau de neurones, il est difficile à expliquer et à interpréter.
  • API : il est également possible d’utiliser des API, déjà très performantes, telles que l’API Natural Language de Google ou l’API Cognitive Services d’Azure.

Toutes ces méthodes conduisent au même résultat qui donne pour chaque message un score de satisfaction permettant de quantifier la satisfaction ou l’insatisfaction du client.

Nlp-3-avisia

Négatif à 95%. Message pour lequel il faut répondre rapidement.

Le topic modeling : détecter automatiquement les thématiques dans les retours clients

La deuxième fonctionnalité principale du NLP est l’extraction de thèmes plus communément appelée topic modeling. Le topic modeling peut s’appliquer à toute forme de texte : mails, tickets, feedbacks, etc. pour avoir une vision globale des préoccupations des clients.

Les principaux modèles de topic modeling sont non-supervisés. C’est-à-dire qu’ils n’apprennent pas à lier des messages à un thème donné, ils découvrent eux-mêmes les thèmes.

Mais avant d’être analysés, les messages doivent passer par la même préparation que pour l’analyse de sentiment. Ensuite, il existe, là encore, plusieurs méthodologies possibles :

  • Latent Dirichlet Allocation (LDA) : modèle probabiliste et algorithmique parcourant les messages pour former des groupes de mots qui co-occurrent souvent et ainsi découvrir des thèmes.
  • Latent Semantic Analysis (LSA) : modèle d’algèbre linéaire décomposant le lien « terme-document » en un lien « terme-thème » + « thème-document ». Il est basé sur la même intuition que la matrix factorization pour la recommandation de produits.
  • Non-negative Matrix Factorization (NMF) : modèle d’algèbre linéaire réalisant le même travail que la LSA pour découvrir des variables latentes, les thèmes. Les deux modèles se différencient par leur méthode de décomposition mais la LSA est plus fréquemment utilisée notamment par son caractère unique et son interprétation un peu plus aisée (grâce à l’importance des thèmes).

Nlp-4-avisia

Ces 3 approches demandent de donner en paramètre le nombre de thèmes. Il existe des critères statistiques pour donner une indication sur le nombre de thèmes optimal mais il reste nécessaire, pour choisir sa méthodologie ou son nombre de thèmes, de s’assurer de la pertinence de l’interprétation des topics.

Les modèles vous fournissent le numéro du thème auquel le message est associé, voire même l’importance relative de chaque thème pour le message. Quoiqu’il en soit, le thème ne sera qu’un listing de mots auquel vous devrez associer vous-mêmes un nom.

Nlp-4-avisia

La classification de messages dans des thèmes connus grâce au Machine Learning

Il est également possible d’associer des messages à des thèmes connus si vous disposez d’anciens messages associés à ces thèmes. Des modèles de Machine Learning permettent d’apprendre le lien entre leurs contenus et les thèmes.

Cette méthode est par exemple utilisée pour classer les mails dans les spams dans les systèmes de messagerie ou plus largement, elle peut être utilisée pour classer des mails et les rediriger vers le service en charge de sa réponse.

Pour effectuer cette tâche, plusieurs modèles existent et notamment l’algorithme des k plus proches voisins (kNN), les SVM, la régression logistique ou les réseaux de neurones.

Les méthodes vues dans cet article peuvent être combinées entre elles ou avec d’autres pour extraire d’autres informations.

Par exemple, le topic modeling, utilisé en parallèle d’une analyse de sentiment, permet de mettre en lumière les sujets de mécontentement des utilisateurs. Il permet de savoir si les clients sont satisfaits ou non d’un service en particulier. Il indique ainsi les services à améliorer en priorité.

Le NLP peut aussi être élargi aux données de centres d’appels ou d’assistants personnels. Des méthodes de text-to-speech permettent de transcrire les données vocales en texte sur lequel toutes les méthodes vues précédemment peuvent s’appliquer.

Les avancées des LLM en NLP : ce qui change en 2024-2025

Depuis la publication initiale de cet article, l’arrivée des grands modèles de langage (Large Language Models, ou LLM) a profondément renouvelé les pratiques du NLP appliqué à l’écoute client. Voici les principales avancées à connaître, avec des sources primaires vérifiables pour aller plus loin.

Les LLM en zero-shot et few-shot pour l’analyse de sentiment

Les LLM comme GPT-4 permettent désormais de réaliser de l’analyse de sentiment sans nécessiter de corpus labélisé ni de ré-entraînement spécifique. Une étude montre qu’un modèle GPT-3.5 fine-tuné sur la tâche d’analyse de sentiment par aspect (ABSA) atteint un score état de l’art, tandis que GPT-4 obtient déjà de très bons résultats en zero-shot et few-shot, sans entraînement dédié. Plus récemment, il a été évalué que les LLM sur de l’analyse de sentiment par aspect multilingue en zero-shot, montrent que des prompts simples peuvent rivaliser avec des méthodes plus complexes, en particulier pour les langues à fortes ressources comme le français ou l’anglais. Concrètement, cela signifie qu’il est désormais possible de démarrer un projet d’analyse de sentiment avec un simple prompt, sans phase préalable de collecte et d’annotation de données, ce qui réduit fortement le temps de mise en œuvre.

Le topic modeling réinventé par les LLM

Le topic modeling traditionnel (LDA, LSA, NMF) souffre d’une limite bien connue : les thèmes obtenus ne sont que des listes de mots, que l’humain doit ensuite interpréter et nommer. Les LLM changent la donne. Le framework TopicGPT, présenté à la conférence NAACL 2024, utilise un LLM pour générer directement des thèmes sous forme de libellés et de descriptions en langage naturel, plus alignés avec la façon dont un humain catégoriserait les documents. Une autre étude de 2024 confirme que les LLM constituent une alternative crédible aux approches traditionnelles de topic modeling, notamment pour l’interprétabilité des résultats. Pour l’écoute client, cela veut dire des thèmes directement exploitables par les équipes métier, sans travail additionnel de nommage.

Mistral Large 2 : une alternative française et souveraine pour le NLP

Pour les entreprises françaises et européennes soucieuses de souveraineté des données, l’écosystème s’est enrichi avec l’arrivée de Mistral Large 2, publié par la start-up française Mistral AI le 24 juillet 2024. Ce modèle de 123 milliards de paramètres est nativement performant en français et dans plusieurs autres langues européennes, et ses performances sont annoncées comme comparables à celles de GPT-4o ou Claude 3 Opus sur plusieurs benchmarks. Mistral AI propose également des modèles plus légers, comme Mistral Small, positionnés par l’éditeur comme adaptés à des tâches telles que la traduction, le résumé ou l’analyse de sentiment, à un coût d’inférence réduit. Cela ouvre la voie à des architectures de NLP hébergées en Europe, un point souvent déterminant dans les projets de nos clients.

En résumé, les LLM ne remplacent pas nécessairement les approches historiques présentées plus haut, mais ils réduisent significativement la barrière à l’entrée : moins de données labélisées nécessaires, des thèmes plus interprétables, et désormais des alternatives européennes performantes.

En conclusion : le NLP, un levier stratégique pour la relation client

Les données textuelles, ou plus généralement de langage, sont omniprésentes et souvent sous-exploitées bien qu’elles contiennent des informations clés. Utiliser des méthodes de NLP comme l’analyse de sentiment, le topic modeling et la classification permet d’être plus à l’écoute de vos clients et ainsi améliorer la prise de décisions stratégiques. La diversification des types de données, l’augmentation du volume de données (sous forme de texte ou de son) vont s’accélérer dans les prochaines années. C’est donc une source d’information capitale pour la relation client et la stratégie de l’entreprise.

Vous souhaitez exploiter la voix de vos clients grâce au NLP et aux LLM ? Contactez nos experts Data & IA pour échanger sur votre projet.

Articles en lien

Data contact

Avec notre expertise, faites parler vos données