SDS Manager
Documentation
Documentation/Classification par LLM

🤖Classification par LLM

Créer des prompts de classification et lancer des jobs de catégorisation automatique de comptes et de posts par LLM.

Ajouter un prompt

Objectif

Créer un prompt de classification qui sera envoyé au LLM pour catégoriser automatiquement des comptes ou des posts.

Étapes

  1. 1

    Dans la barre latérale, ouvrez Classification par LLM et cliquez sur Ajouter un prompt.

  2. 2

    Renseignez les champs du formulaire :

    ChampDescriptionExemple
    NomIdentifiant lisible du prompt pour le retrouver dans la bibliothèque.Classification politique comptes FR
    FournisseurChoisissez un fournisseur de LLM. Actuellement seul OpenAI est supporté.OpenAI
    ModèleModèle de LLM à utiliser pour la classification.gpt-4o-mini
  3. 3

    Décrivez le rôle du LLM. Par exemple "Tu es un analyste politique expert en lutte contre la désinformation.".

  4. 4

    Posez vos questions au LLM et indiquez lui le format de réponse attendu.

  5. 5

    Renseignez les champs du formulaire :

    ChampDescriptionExemple
    QuestionQuestion à poser au LLM pour la classification.Quel est le sentiment de ce message ? Quel est le thème politique abordé ? Ce compte est-il pro-russe ?
    Nom de la cléNommez le champ de métadonnée qui contiendra la réponse du LLM. Par exemple `sentiment`, `theme` ou `orientation_politique`.sentiment
    TypeType de réponse attendue du LLM. Par exemple : choix unique, texte libre, nombre, réponse multiple...Choix unique
    Choix possiblesListe des choix possibles pour le LLM. Par exemple : positif, négatif, neutre.positif, négatif, neutre
  6. 6

    Cliquez sur Créer. Le prompt est sauvegardé et visible dans l'onglet Prompts LLM du dashboard.

✓ Résultat attendu

Le prompt est disponible dans la bibliothèque et peut être sélectionné lors d'un job de classification.

Catégorisation de comptes

Objectif

Lancer un job de classification automatique des comptes présents dans une importation, en utilisant un prompt LLM prédéfini.

Prérequis

  • Avoir collecté des données sur une importation.
  • Avoir créé un prompt LLM.

Étapes

  1. 1

    Dans Classification par LLM, cliquez sur Catégorisation de comptes.

  2. 2

    Sélectionnez le Client, le Projet et l'Importation.

  3. 3

    Sélectionnez le Prompt LLM à appliquer.

  4. 4

    Désactivez l'option batching si vous souhaitez obtenir une classification immédiate sur la voie OpenAI (le mode batching réduit le coût de 50% mais les résultats sont disponibles jusqu'à 24 heures après le lancement du job).

  5. 5

    Choisissez le Moteur de classification :

    ChampDescriptionExemple
    AutomatiqueLe corpus est lu, ses tokens comptés, et le moteur le moins cher est retenu : OpenAI (facturé au token) ou GPU RunPod (facturé au temps, avec un coût de démarrage fixe). Au-delà de 80 000 items, le GPU est retenu sans estimation.Automatique
    OpenAIForce la voie OpenAI (Batch ou appels directs selon l'option batching).OpenAI
    GPU (RunPod)Force le modèle local sur l'endpoint RunPod. Refusé si l'endpoint n'est pas configuré.GPU (RunPod)
    Délai maximum (heures)Mode automatique avec batching uniquement : sous 24 h, le Batch OpenAI est écarté et le GPU est retenu, quel que soit le prix.4
  6. 6

    (facultatif) Cliquez sur Estimer le coût : la comparaison OpenAI / GPU, le moteur qui serait retenu et le seuil de bascule s'affichent sans rien lancer.

  7. 7

    (facultatif - recommandé sur les collectes par mots-clés) Pour améliorer la classification des comptes, nous pouvons chercher des posts supplémentaires au sein d'autres importations. Sélectionnez les importations complémentaires pour enrichir vos données.

  8. 8

    (facultatif ) Filtrez les posts éligibles à la classification des comptes.

  9. 9

    Configurez les paramètres additionnels si disponibles :

    ChampDescriptionExemple
    Taille du batchNombre de comptes envoyés au LLM en une seule requête. Réduire ce chiffre améliore la précision mais augmente le coût et la durée.20
  10. 10

    Cliquez sur Lancer.

✓ Résultat attendu

Chaque compte de l'importation reçoit un label de catégorie défini dans le prompt. Les résultats sont exportables en CSV.

Erreurs fréquentes

ErreurCause probableSolution
Catégorie `inconnu` trop fréquenteLe prompt est trop ambigu ou les catégories ne sont pas assez bien définies.Révisez les descriptions de catégories dans le prompt pour les rendre plus discriminantes.
Coût LLM inattendu élevéL'importation contient un nombre de comptes très élevé avec un grand nombre de posts à classer.Réduisez la taille du corpus en filtrant l'importation avant de lancer la classification.

Classification de posts

Objectif

Lancer un job de classification automatique des posts d'une importation, en utilisant un prompt LLM.

Prérequis

  • Avoir collecté des données sur une importation.
  • Avoir créé un prompt LLM.
  • Avoir créé une analyse et réalisé l'étape de chunking.

Étapes

  1. 1

    Dans Classification par LLM, cliquez sur Classification de posts.

  2. 2

    Sélectionnez le Client, le Projet et l'Importation.

  3. 3

    Sélectionnez le Prompt LLM à appliquer.

  4. 4

    Désactivez l'option batching si vous souhaitez obtenir une classification immédiate sur la voie OpenAI (le mode batching réduit le coût de 50% mais les résultats sont disponibles jusqu'à 24 heures après le lancement du job).

  5. 5

    Choisissez le Moteur de classification :

    ChampDescriptionExemple
    AutomatiqueLe corpus est lu, ses tokens comptés, et le moteur le moins cher est retenu : OpenAI (facturé au token) ou GPU RunPod (facturé au temps, avec un coût de démarrage fixe). Au-delà de 80 000 items, le GPU est retenu sans estimation.Automatique
    OpenAIForce la voie OpenAI (Batch ou appels directs selon l'option batching).OpenAI
    GPU (RunPod)Force le modèle local sur l'endpoint RunPod. Refusé si l'endpoint n'est pas configuré.GPU (RunPod)
    Délai maximum (heures)Mode automatique avec batching uniquement : sous 24 h, le Batch OpenAI est écarté et le GPU est retenu, quel que soit le prix.4
  6. 6

    (facultatif) Cliquez sur Estimer le coût : la comparaison OpenAI / GPU, le moteur qui serait retenu et le seuil de bascule s'affichent sans rien lancer.

  7. 7

    (facultatif) Ajoutez des informations contextuelles aux posts (citations associés, paragraphes connexes, informations sur l'auteur ou détails du posts).

  8. 8

    Cliquez sur Lancer.

✓ Résultat attendu

Chaque chunk se voit attribuer une catégorie. Les résultats sont disponibles dans les exports et peuvent alimenter des tableaux de bord.

Hate speech

Objectif

Détecter les discours haineux sur les chunks d'une analyse, en deux phases : une modération OpenAI sur tout le corpus, puis Shieldstral-1.0-3B sur les seuls chunks signalés, qui les classe par axe de haine (race, religion, origine, genre, âge, handicap, affiliation politique, plus des axes personnalisés).

Prérequis

  • Avoir effectué le chunking sur l'analyse.
  • Avoir créé un prompt Shieldstral depuis **Ajouter un prompt** (provider Mistral — Shieldstral).

Étapes

  1. 1

    Dans Classification par LLM, cliquez sur Hate speech.

  2. 2

    Sélectionnez le Client, le Projet et l'Analyse. (facultatif) Saisissez des chunks_ids pour ne traiter que certains chunks.

  3. 3

    Sélectionnez le Prompt Shieldstral. Seuls les prompts Shieldstral sont proposés. Les axes, le seuil et l'activation de la phase 2 y sont déjà définis et s'affichent en rappel.

  4. 4

    Configurez le traitement :

    ChampDescriptionExemple
    Tout refaire (force_all)Désactivé, seul ce qui manque est traité, au niveau (chunk, axe) en phase 2. Activé, tout est refait et repayé. Toujours désactivé sur un run planifié.désactivé
    Reseuiller uniquementAucun appel API : recalcule les yes/no depuis les scores déjà en base avec le seuil du prompt. Sert à appliquer un nouveau seuil sans rien repayer.désactivé
  5. 5

    (facultatif) Restreignez le corpus avec les filtres narratifs, claims ou classification LLM. Ils s'appliquent en AND et ne peuvent que réduire le corpus.

  6. 6

    (facultatif) Dépliez Paramètres avancés : lettres utiles minimum, modèle et effort de rédaction des axes personnalisés. Les champs affichent les valeurs par défaut de la CF ; seules les valeurs modifiées sont envoyées.

  7. 7

    Choisissez quand lancer : Maintenant, À une date précise, ou Planifier uniquement. Une récurrence peut être ajoutée.

  8. 8

    Cliquez sur Lancer la détection.

✓ Résultat attendu

Les verdicts sont écrits sous le prompt : une clé `moderation` (catégorie déclenchante ou `no`), une clé `appel_violence` (`yes`/`no`), puis une clé par axe (`yes`/`no` au seuil de l'axe, avec le score).