🤖Classification par LLM
Créer des prompts de classification et lancer des jobs de catégorisation automatique de comptes et de posts par LLM.
Ajouter un prompt
Objectif
Créer un prompt de classification qui sera envoyé au LLM pour catégoriser automatiquement des comptes ou des posts.
Étapes
- 1
Dans la barre latérale, ouvrez Classification par LLM et cliquez sur Ajouter un prompt.
- 2
Renseignez les champs du formulaire :
Champ Description Exemple Nom Identifiant lisible du prompt pour le retrouver dans la bibliothèque. Classification politique comptes FR Fournisseur Choisissez un fournisseur de LLM. Actuellement seul OpenAI est supporté. OpenAI Modèle Modèle de LLM à utiliser pour la classification. gpt-4o-mini - 3
Décrivez le rôle du LLM. Par exemple "Tu es un analyste politique expert en lutte contre la désinformation.".
- 4
Posez vos questions au LLM et indiquez lui le format de réponse attendu.
- 5
Renseignez les champs du formulaire :
Champ Description Exemple Question Question à poser au LLM pour la classification. Quel est le sentiment de ce message ? Quel est le thème politique abordé ? Ce compte est-il pro-russe ? Nom de la clé Nommez le champ de métadonnée qui contiendra la réponse du LLM. Par exemple `sentiment`, `theme` ou `orientation_politique`. sentiment Type Type de réponse attendue du LLM. Par exemple : choix unique, texte libre, nombre, réponse multiple... Choix unique Choix possibles Liste des choix possibles pour le LLM. Par exemple : positif, négatif, neutre. positif, négatif, neutre - 6
Cliquez sur Créer. Le prompt est sauvegardé et visible dans l'onglet Prompts LLM du dashboard.
✓ Résultat attendu
Le prompt est disponible dans la bibliothèque et peut être sélectionné lors d'un job de classification.
Catégorisation de comptes
Objectif
Lancer un job de classification automatique des comptes présents dans une importation, en utilisant un prompt LLM prédéfini.
Prérequis
- Avoir collecté des données sur une importation.
- Avoir créé un prompt LLM.
Étapes
- 1
Dans Classification par LLM, cliquez sur Catégorisation de comptes.
- 2
Sélectionnez le Client, le Projet et l'Importation.
- 3
Sélectionnez le Prompt LLM à appliquer.
- 4
Désactivez l'option batching si vous souhaitez obtenir une classification immédiate sur la voie OpenAI (le mode batching réduit le coût de 50% mais les résultats sont disponibles jusqu'à 24 heures après le lancement du job).
- 5
Choisissez le Moteur de classification :
Champ Description Exemple Automatique Le corpus est lu, ses tokens comptés, et le moteur le moins cher est retenu : OpenAI (facturé au token) ou GPU RunPod (facturé au temps, avec un coût de démarrage fixe). Au-delà de 80 000 items, le GPU est retenu sans estimation. Automatique OpenAI Force la voie OpenAI (Batch ou appels directs selon l'option batching). OpenAI GPU (RunPod) Force le modèle local sur l'endpoint RunPod. Refusé si l'endpoint n'est pas configuré. GPU (RunPod) Délai maximum (heures) Mode automatique avec batching uniquement : sous 24 h, le Batch OpenAI est écarté et le GPU est retenu, quel que soit le prix. 4 - 6
(facultatif) Cliquez sur Estimer le coût : la comparaison OpenAI / GPU, le moteur qui serait retenu et le seuil de bascule s'affichent sans rien lancer.
- 7
(facultatif - recommandé sur les collectes par mots-clés) Pour améliorer la classification des comptes, nous pouvons chercher des posts supplémentaires au sein d'autres importations. Sélectionnez les importations complémentaires pour enrichir vos données.
- 8
(facultatif ) Filtrez les posts éligibles à la classification des comptes.
- 9
Configurez les paramètres additionnels si disponibles :
Champ Description Exemple Taille du batch Nombre de comptes envoyés au LLM en une seule requête. Réduire ce chiffre améliore la précision mais augmente le coût et la durée. 20 - 10
Cliquez sur Lancer.
✓ Résultat attendu
Chaque compte de l'importation reçoit un label de catégorie défini dans le prompt. Les résultats sont exportables en CSV.
Erreurs fréquentes
| Erreur | Cause probable | Solution |
|---|---|---|
| Catégorie `inconnu` trop fréquente | Le prompt est trop ambigu ou les catégories ne sont pas assez bien définies. | Révisez les descriptions de catégories dans le prompt pour les rendre plus discriminantes. |
| Coût LLM inattendu élevé | L'importation contient un nombre de comptes très élevé avec un grand nombre de posts à classer. | Réduisez la taille du corpus en filtrant l'importation avant de lancer la classification. |
Classification de posts
Objectif
Lancer un job de classification automatique des posts d'une importation, en utilisant un prompt LLM.
Prérequis
- Avoir collecté des données sur une importation.
- Avoir créé un prompt LLM.
- Avoir créé une analyse et réalisé l'étape de chunking.
Étapes
- 1
Dans Classification par LLM, cliquez sur Classification de posts.
- 2
Sélectionnez le Client, le Projet et l'Importation.
- 3
Sélectionnez le Prompt LLM à appliquer.
- 4
Désactivez l'option batching si vous souhaitez obtenir une classification immédiate sur la voie OpenAI (le mode batching réduit le coût de 50% mais les résultats sont disponibles jusqu'à 24 heures après le lancement du job).
- 5
Choisissez le Moteur de classification :
Champ Description Exemple Automatique Le corpus est lu, ses tokens comptés, et le moteur le moins cher est retenu : OpenAI (facturé au token) ou GPU RunPod (facturé au temps, avec un coût de démarrage fixe). Au-delà de 80 000 items, le GPU est retenu sans estimation. Automatique OpenAI Force la voie OpenAI (Batch ou appels directs selon l'option batching). OpenAI GPU (RunPod) Force le modèle local sur l'endpoint RunPod. Refusé si l'endpoint n'est pas configuré. GPU (RunPod) Délai maximum (heures) Mode automatique avec batching uniquement : sous 24 h, le Batch OpenAI est écarté et le GPU est retenu, quel que soit le prix. 4 - 6
(facultatif) Cliquez sur Estimer le coût : la comparaison OpenAI / GPU, le moteur qui serait retenu et le seuil de bascule s'affichent sans rien lancer.
- 7
(facultatif) Ajoutez des informations contextuelles aux posts (citations associés, paragraphes connexes, informations sur l'auteur ou détails du posts).
- 8
Cliquez sur Lancer.
✓ Résultat attendu
Chaque chunk se voit attribuer une catégorie. Les résultats sont disponibles dans les exports et peuvent alimenter des tableaux de bord.
Hate speech
Objectif
Détecter les discours haineux sur les chunks d'une analyse, en deux phases : une modération OpenAI sur tout le corpus, puis Shieldstral-1.0-3B sur les seuls chunks signalés, qui les classe par axe de haine (race, religion, origine, genre, âge, handicap, affiliation politique, plus des axes personnalisés).
Prérequis
- Avoir effectué le chunking sur l'analyse.
- Avoir créé un prompt Shieldstral depuis **Ajouter un prompt** (provider Mistral — Shieldstral).
Étapes
- 1
Dans Classification par LLM, cliquez sur Hate speech.
- 2
Sélectionnez le Client, le Projet et l'Analyse. (facultatif) Saisissez des chunks_ids pour ne traiter que certains chunks.
- 3
Sélectionnez le Prompt Shieldstral. Seuls les prompts Shieldstral sont proposés. Les axes, le seuil et l'activation de la phase 2 y sont déjà définis et s'affichent en rappel.
- 4
Configurez le traitement :
Champ Description Exemple Tout refaire (force_all) Désactivé, seul ce qui manque est traité, au niveau (chunk, axe) en phase 2. Activé, tout est refait et repayé. Toujours désactivé sur un run planifié. désactivé Reseuiller uniquement Aucun appel API : recalcule les yes/no depuis les scores déjà en base avec le seuil du prompt. Sert à appliquer un nouveau seuil sans rien repayer. désactivé - 5
(facultatif) Restreignez le corpus avec les filtres narratifs, claims ou classification LLM. Ils s'appliquent en AND et ne peuvent que réduire le corpus.
- 6
(facultatif) Dépliez Paramètres avancés : lettres utiles minimum, modèle et effort de rédaction des axes personnalisés. Les champs affichent les valeurs par défaut de la CF ; seules les valeurs modifiées sont envoyées.
- 7
Choisissez quand lancer : Maintenant, À une date précise, ou Planifier uniquement. Une récurrence peut être ajoutée.
- 8
Cliquez sur Lancer la détection.
✓ Résultat attendu
Les verdicts sont écrits sous le prompt : une clé `moderation` (catégorie déclenchante ou `no`), une clé `appel_violence` (`yes`/`no`), puis une clé par axe (`yes`/`no` au seuil de l'axe, avec le score).