corpusSummarize - Résumé automatique de corpus
Niveau d'utilisation :
Avancé
Niveau de validation :
Expérimental
Objectif
Ce web service analyse un corpus de résumés écrits en anglais pour en générer un résumé.
Méthode
Plusieurs étapes sont réalisées pour parvenir au résumé :
-
- La ressemblance des documents est calculée grâce à leur vectorisation (embedding).
- La taille des vecteurs est réduite grâce à l’algorithme UMAP.
- Les proximités entre ces vecteurs sont comparés en utilisant la distance cosinus.
- Les documents similaires sont regroupés en clusters (une thématique distincte par cluster) grâce à l’algorithme des k-means. Le nombre de clusters est déterminé de manière automatique.
- Pour chaque cluster, sont identifiés les documents les plus représentatifs (les plus proches de l’isobarycentre).
- Les mots clés les plus pertinents de l’ensemble des documents de chaque cluster sont extraits grâce au web service Teeft.
Tous ces éléments construisent une base de connaissances restreinte du corpus. Nous utilisons ensuite le modèle gemma-4-31b pour rédiger le résumé.
Métriques
Nous n’avons actuellement ni données ni métriques pour évaluer cette tâche.
Références
Pour l’algorithme UMAP :
- Leland McInnes, John Healy, James Melville (2018) UMAP : Uniform Manifold Approximation and Projection for Dimension Reduction arXiv:1802.03426 https://doi.org/10.48550/arXiv.1802.03426
Pour l’algorithme des k-means :
- Ahmed, M., Seraj, R., & Islam, S. M. S. (2020). The k-means Algorithm: A Comprehensive Survey and Performance Evaluation. Electronics, 9(8), 1295. https://doi.org/10.3390/electronics9081295
Ces web services qui peuvent vous intéresser
Résumé automatique d'un article scientifique
Extraction de termes d'un corpus
Extraction de clusters d'un corpus
Présent sur TDM Factory
LIEN VERS TDM FACTORY
Aller à TDM Factory
Utilisation dans TDM Factory
Ce web service se lance sur :
– un corpus au format CSV
– un corpus Istex au format targz
Absent de Lodex
Variantes
Langues du résumé en sortie
- Anglais : https://data-corpussummarize.services.istex.fr/v1/abstract?langOutput=en
- Français : https://data-corpussummarize.services.istex.fr/v1/abstract?langOutput=fr