SDS Manager
Documentation
Documentation/Topics — annotation & analyse

🏷️Topics — annotation & analyse

Explorer et annoter les clusters produits par un topic modeling, sur les six modalités : textes, OCR, transcriptions, images, keyframes et scènes.

Le principe : une analyse, une modalité

Cette section est le pendant lecture des pages qui lancent les traitements. « Pipelines → Topic modeling » et « Analyser → Clustering » produisent des clusters ; c'est ici qu'on les regarde et qu'on les nomme.

Objectif

Comprendre ce que la section affiche, et pourquoi une analyse ne mélange jamais deux types de contenu.

Étapes

  1. Une analyse de topic modeling ne porte qu'une seule modalité — sa verticale. La table des chunks ne contient, pour une analyse donnée, que des vecteurs de texte ou que des vecteurs visuels. Analyser conjointement des textes et des images n'aurait pas de sens : les distances calculées ne seraient pas comparables.
  2. Les six verticales

    ChampDescriptionExemple
    TextesClustering sémantique du texte des posts.Tweets, publications LinkedIn
    OCRClustering du texte extrait des images. Seule verticale mixte à l'affichage : le contenu jugé est du texte, mais l'image source reste consultable — un OCR bruité ne se juge pas sans la voir.Texte d'une infographie, d'une capture d'écran
    TranscriptionsClustering des transcriptions audio des vidéos.Paroles d'une vidéo TikTok
    ImagesClustering visuel des images des posts, sur leurs embeddings CLIP.Photos, visuels de campagne
    KeyframesClustering visuel des images clés extraites des vidéos.Plans marquants d'une vidéo
    ScènesClustering visuel des scènes vidéo, sur l'embedding moyen de la scène.Séquences d'un reportage
  3. Conséquence pratique : il n'y a aucune comparaison croisée entre verticales. Pour lire une importation sous plusieurs angles, on ouvre successivement chacune de ses analyses.

✓ Résultat attendu

Vous savez que chaque analyse listée porte une seule modalité, indiquée par son badge de verticale.

Choisir une analyse

L'inventaire vit sur la page d'accueil

Objectif

Retrouver une analyse de topic modeling et l'ouvrir en annotation.

Prérequis

  • Avoir lancé un topic modeling, par « Pipelines → Topic modeling » ou en séquençant « Analyser → Clustering ».

Étapes

  1. La section Topics n'a pas d'inventaire propre : c'est l'onglet Analyses de la page d'accueil qui liste toutes les analyses. L'entrée « Topics » du menu y conduit directement. Un seul tableau, donc, plutôt que deux à tenir à jour — et il se charge sans agrégat coûteux.
  2. 1

    Depuis l'accueil, ouvrez l'onglet Analyses, puis filtrez par Client, Type ou Projet.

  3. 2

    Cliquez sur l'icône Annoter de la ligne voulue.

  4. Cette icône est proposée sur toutes les lignes, y compris des analyses qui ne relèvent pas du topic modeling. C'est délibéré : le seul critère exact est « l'analyse porte des clusters », information que cet inventaire n'a pas. La masquer d'après le type de l'analyse rendait invisibles la plupart des analyses réellement annotables — celles du pipeline, dont le type est composite (`clustering_text`, `clustering_image`…), et celles construites étape par étape, dont le type est un intitulé libre. Ouvrir une analyse sans cluster coûte un clic et affiche un message explicite.

✓ Résultat attendu

L'écran d'annotation s'ouvre sur l'analyse, avec ses clusters et sa carte.

Erreurs fréquentes

ErreurCause probableSolution
« Analyse non exploitable pour l'annotation »La modalité de l'analyse n'a pas pu être déterminée : soit elle ne porte encore aucun chunk, soit ses chunks mélangent textes et images — un mode de lancement proscrit.Le message donne le motif exact. Si l'analyse n'a pas de chunk, lancez le chunking et la vectorisation. Si elle est mixte, relancez un topic modeling en verticale OCR.
« Cette analyse ne référence aucune importation »L'analyse ne déclare aucune importation et n'a aucun chunk permettant de la déduire.Vérifiez que le chunking a bien tourné sur cette analyse avant de l'annoter.

Explorer une analyse

Objectif

Lire la composition thématique d'un corpus : volumétrie, évolution, tonalité, et contenu de chaque cluster.

Prérequis

  • Avoir ouvert une analyse depuis l'onglet Analyses de l'accueil.

Étapes

  1. 1

    Ajustez la barre de Filtres si vous voulez restreindre le périmètre :

    ChampDescriptionExemple
    Depuis le / Jusqu'auBornes de période. La date de fin est inclusive : la journée entière est prise en compte.01/01/2026 → 30/06/2026
    LanguesLangues des posts. Vide = toutes les langues.fr, en
    Comptes auteursRestreint aux posts de certains comptes, séparés par des virgules.opsci, monclient
    Types de posts inclusPosts originaux, commentaires, retweets, citations. Les partages et citations sont analysés à part car leurs métriques d'engagement ne se décomposent pas. **« Retweets » couvre les deux formes de repartage** : le lien vers le post repartagé, et la ligne de repartage elle-même — celle qui, sur TruthSocial, Threads et Telegram, porte une copie des visuels du post d'origine. Décoché (le défaut), le même visuel ne ressort donc plus une fois par repost dans l'onglet Images.Posts originaux + Commentaires
  2. Le bruit est toujours exclu des chiffres. Le topic marqué `DELETE` regroupe ce que le clustering n'a pas su rattacher. Sa part est affichée à côté des tuiles, comme indicateur de couverture du clustering — jamais fondue dans les totaux.
  3. Les tuiles de volumétrie sont calculées par l'API et non par addition des lignes du tableau. Un post peut appartenir à plusieurs clusters, et le nombre de comptes uniques n'est pas additionnable entre clusters : une somme donnerait des chiffres faux.
  4. 2

    Choisissez l'Agrégation :

    ChampDescriptionExemple
    Par clusterUne ligne par cluster, tel que produit par l'algorithme.41 lignes
    Par labelRegroupe les clusters partageant un même nom — c'est la vue qui reflète les fusions faites à l'annotation.28 lignes après fusions
  5. Sur le sentiment par cluster, concentrez la lecture sur les clusters nettement positifs ou négatifs : le neutre n'est pas informatif, et un cluster majoritairement neutre ne dit rien de la tonalité du corpus.
  6. 3

    Cliquez une ligne du tableau des clusters pour ouvrir son détail. La courbe d'évolution se restreint alors à ce cluster.

  7. Le détail d'un cluster propose ses nuages de mots et six onglets de lecture : posts, images, comptes, hashtags, URLs et domaines. Les onglets tabulaires s'exportent en CSV.
  8. Les nuages de mots répondent à deux questions différentes. L'onglet Khi-deux donne les termes les plus *spécifiques* au cluster comparé aux autres — généralement les plus utiles pour le nommer. L'onglet Fréquence donne les termes les plus courants, souvent dominés par le vocabulaire commun à tout le corpus.
  9. Les nuages sont construits à partir du texte lemmatisé des chunks. Ils exigent donc que la lemmatisation ait tourné avant le clustering — voir la sous-section sur les deux parcours. Les verticales visuelles n'en ont pas : on y juge le cluster sur sa planche-contact.

✓ Résultat attendu

Vous savez de quoi parle chaque cluster, quel volume il pèse, qui l'anime et comment il évolue.

Erreurs fréquentes

ErreurCause probableSolution
« Cette analyse ne référence aucune importation »Aucune importation n'a pu être associée à l'analyse, ni par ses métadonnées ni par ses documents.Vérifiez que l'analyse porte bien des chunks rattachés à des documents. Sans importation, aucun agrégat ne peut être calculé.
Le graphique de sentiment est videAucun sentiment n'a été calculé sur cette analyse, ou sa verticale est visuelle — le sentiment porte sur du texte.Lancez « Analyser → Sentiment » sur l'analyse si elle est textuelle. Sur une verticale visuelle, le graphique n'est simplement pas proposé.
L'export CSV annonce un nombre de lignes plafonnéL'export est borné à 10 000 lignes pour ne pas saturer le navigateur.Restreignez la période ou le périmètre pour descendre sous ce seuil, ou passez par « Générer un rapport » pour un export volumineux.

Annoter les clusters

Nommer, fusionner, écarter le bruit

Objectif

Donner un nom lisible à chaque cluster, réunir ceux qui traitent du même sujet, et écarter ceux qui n'apportent rien.

Prérequis

  • Avoir ouvert une analyse portant des clusters.
  • Idéalement, avoir lu l'écran Explorer pour connaître le corpus.

Étapes

  1. Un cluster est considéré annoté dès qu'il porte un label. Il n'y a pas d'état de relecture séparé : la présence du nom est la marque du travail fait.
  2. Les clusters sont présentés dans l'ordre de travail : non annotés d'abord, les plus volumineux en tête, le bruit à la fin. La barre de progression indique ce qui reste.
  3. 1

    Sélectionnez un cluster, dans la Table ou dans le Nuage de points.

  4. Dans le nuage, la couleur porte le cluster et le remplissage porte l'avancement : un point creux appartient à un cluster restant à annoter, un point plein à un cluster déjà nommé. La surface pleine progresse donc à mesure que le travail avance.
  5. 2

    Jugez le cluster avec les éléments du panneau de droite : nuages de mots pour les verticales textuelles, planche-contact pour les verticales visuelles, et membres classés par représentativité.

  6. 3

    Saisissez le Label du cluster puis validez avec Entrée.

    ChampDescriptionExemple
    LabelNom court et parlant du thème. Il apparaîtra dans tous les livrables et dans les filtres analytiques.Souveraineté numérique
  7. Raccourcis clavier

    ChampDescriptionExemple
    nAller au prochain cluster à annoter. C'est le seul chemin vers cette action : il n'y a pas de bouton équivalent.n
    j / →Cluster suivant.j
    k / ←Cluster précédent.k
    lPlacer le curseur dans le champ de label.l
    dMarquer le cluster comme bruit.d
    EntréeValider le label et passer au cluster suivant à annoter.Entrée
  8. Fusionner deux clusters consiste simplement à leur donner le même label. Sélectionnez-les dans la table, ou encerclez-les au lasso dans le nuage, puis saisissez le label commun. La vue « Par label » de l'écran Explorer les présentera réunis.
  9. Marquer comme bruit pose le label `DELETE`. Ce n'est pas un nom parmi d'autres : toute l'analytique en aval exclut ce topic — volumétrie, sentiment, comptes, entités. Réservez-le aux clusters réellement hors sujet.
  10. 4

    Utilisez Compléter au LLM pour faire nommer automatiquement les clusters encore sans label.

  11. Les labels déjà posés à la main sont transmis au modèle comme contrainte : il ne réutilisera pas un nom existant, et n'écrasera aucune annotation humaine. Sans cette précaution, un doublon de label fusionnerait silencieusement deux clusters distincts.
  12. 5

    Cliquez l'appareil photo de la Carte des clusters pour la télécharger en PNG, à 2 000 px sur le grand côté.

  13. L'image contient le nuage seul : ni légende d'avancement, ni volumétrie, ni boutons, et aucune marque de sélection — la figure montre la structure du corpus, pas l'état du travail. Elle reproduit en revanche la carte telle qu'elle est réglée : cadrage, zoom, mode « Isoler », noms des clusters. Réglez la vue sur ce que vous voulez montrer, puis exportez.
  14. 6

    Sur une verticale visuelle, exportez les Planches contact en JPG : « Exporter les planches » produit un fichier par cluster, l'appareil photo d'une planche ne télécharge que celle-là.

  15. L'export groupé charge les planches par vagues, faute de quoi celles jamais affichées sortiraient vides : comptez une bonne minute sur une analyse à quarante clusters, et autorisez le téléchargement multiple que demande le navigateur. Le compte rendu indique les planches sans média et celles qui n'ont pas chargé à temps ; « Interrompre » arrête l'export en cours de route.

Schéma

Molette pour zoomer · Cliquer-glisser pour naviguer

✓ Résultat attendu

La barre de progression atteint 100 %, et chaque cluster porte un nom exploitable dans les livrables.

Erreurs fréquentes

ErreurCause probableSolution
« cluster_ids introuvables pour l'analyse »Un cluster sélectionné n'existe plus — typiquement parce que le clustering a été relancé entre-temps, ce qui réattribue les identifiants.Rafraîchissez la page pour recharger la liste des clusters. Aucune modification n'a été appliquée : une fusion partielle est refusée en bloc.
Aucun nuage de mots n'apparaîtSur une verticale visuelle, c'est normal : il n'y a pas de texte à analyser. Sur une verticale textuelle, cela signifie que la lemmatisation n'a pas tourné avant le clustering — les nuages sont construits depuis le texte lemmatisé des chunks, et le parcours unitaire ne lemmatise pas.Sur une verticale visuelle, jugez le cluster sur sa planche-contact. Sur une verticale textuelle, lancez « Analyser → Lemmatisation » puis le clustering — mais attention : relancer le clustering d'une analyse déjà annotée détruit ses labels. Sur une analyse en cours d'annotation, nommez les clusters à partir des posts représentatifs.
Les vignettes affichent « Média indisponible »Le fichier n'a pas été téléchargé, ou son téléchargement a définitivement échoué côté source.Survolez la vignette pour lire le motif. Relancez « Préparer → Télécharger les documents » si les médias n'ont jamais été récupérés.
Les vignettes affichent « Média illisible »Le service de médias n'a pas pu signer l'accès au fichier stocké.Signalez-le à l'équipe technique : le compte de service a besoin du droit de signature sur le stockage.
Aucun label n'apparaît après « Compléter au LLM »Le traitement est asynchrone, ou la verticale déclarée ne correspond pas au contenu réel de l'analyse.Patientez quelques minutes puis rafraîchissez. Si rien n'apparaît, vérifiez que le badge de verticale de l'analyse correspond bien à son contenu.

Attention : relancer un clustering détruit les annotations

Objectif

Comprendre pourquoi un ré-entraînement fait perdre le travail d'annotation, et comment l'éviter.

Étapes

  1. Relancer le clustering d'une analyse supprime tous ses clusters avant d'en créer de nouveaux. Les labels posés à la main sont donc perdus, définitivement.
  2. Ils ne pourraient pas être rattachés de toute façon : l'algorithme réattribue les identifiants de cluster à chaque entraînement, et les regroupements eux-mêmes changent. Un label ancien ne désignerait plus le même contenu.
  3. Les pages « Pipelines → Topic modeling » et « Analyser → Clustering » affichent un avertissement rouge lorsque l'analyse ciblée porte déjà des annotations. Prenez-le au sérieux.
  4. La bonne pratique : figer les paramètres de clustering avant d'annoter. Si un ré-entraînement est nécessaire, lancez-le sur une nouvelle analyse pour conserver le travail existant.

✓ Résultat attendu

Vous ne perdez pas d'annotation par surprise, et vous savez qu'un nouvel essai de clustering doit viser une nouvelle analyse.

Les deux façons de produire un topic modeling

Objectif

Savoir quel parcours choisir, et ce qui change dans la section Topics selon celui utilisé.

Étapes

  1. Parcours orchestré — « Pipelines → Topic modeling » enchaîne automatiquement toutes les étapes selon la verticale choisie : téléchargement, OCR ou transcription, découpage, vectorisation, clustering, annotation. C'est le chemin recommandé.
  2. Parcours unitaire — on séquence les étapes à la main : « Analyser → Créer une analyse », puis Chunking, Vectorisation, Clustering, Annotation. Utile pour reprendre une étape isolée ou régler finement chaque paramètre.
  3. Les deux aboutissent aux mêmes clusters. Deux différences se voient toutefois dans la section Topics, et l'une comme l'autre méritent l'attention.
  4. Première différence — la verticale. Le parcours orchestré l'enregistre ; le parcours unitaire ne la conserve pas. Elle est alors déduite du contenu de l'analyse, et signalée par un « ~ » devant le badge. Aucune conséquence sur les résultats.
  5. Seconde différence — les nuages de mots. Ils sont calculés à partir du texte lemmatisé des chunks. Le parcours orchestré lance la lemmatisation automatiquement ; le parcours unitaire tel que décrit plus haut ne la contient pas. Sans elle, les clusters n'auront aucun nuage de mots, et il faudra les nommer sur les seuls posts représentatifs.
  6. Sur le parcours unitaire, insérez donc « Analyser → Lemmatisation » entre la vectorisation et le clustering. Y penser après coup coûte cher : les nuages ne se calculent qu'au moment du clustering, et le relancer purgerait les clusters — donc détruirait les annotations déjà posées.
  7. Veillez enfin à choisir la même verticale à l'étape Clustering et à l'étape Annotation. Une analyse de keyframes annotée en « Images » ne produirait aucun label : le modèle chercherait le visuel au mauvais endroit.

Schéma

Molette pour zoomer · Cliquer-glisser pour naviguer

✓ Résultat attendu

Vous choisissez le parcours adapté et savez interpréter le badge de verticale qui en résulte.