Semantic Scholar
Valeur ajoutée gratuite
Guide complet des outils d’IA Site d’apprentissage de l’IA

Semantic Scholar

Plateforme de recherche assistée par l’IA pour la recherche, le filtrage et la compréhension des articles académiques

Étiquettes :

Qu’est-ce que Semantic Scholar ?

Semantic Scholar est une plateforme gratuite de recherche académique et de découverte d’articles, mise au point par l’Allen Institute for Artificial Intelligence. Elle utilise le traitement du langage naturel, l’apprentissage automatique et des graphes académiques pour aider les chercheurs à rechercher des articles, à comprendre les résumés, à suivre les citations, à gérer leurs listes de lecture, et à recevoir en continu des recommandations personnalisées.

Ce n’est pas un outil de recherche approfondie générative, mais plutôt une infrastructure académique basée sur les métadonnées des articles réels et leurs relations de citation. La page officielle du produit indique actuellement la couverture de plus de 214 millions d’articles provenant de diverses disciplines, de 2,49 milliards de relations de citation et de 79 millions d’auteurs.

Recherche de thèses interdisciplinaires

Les utilisateurs peuvent effectuer des recherches par titre de thèse, mots-clés, auteur et sujet, et affiner les résultats en utilisant des critères tels que la revue ou le colloque, l’auteur, le type de publication et la période de date. Les résultats de recherche affichent l’auteur, l’année, le nombre de citations, le résumé, le statut d’accès ouvert et un lien vers le PDF disponible.

Un champ de recherche large ne signifie pas que chaque enregistrement soit complet. Les articles peuvent manquer d’abstract, du texte intégral, de types de références ou d’informations normales sur les auteurs ;

Une revue formelle doit encore être complétée par Web of Science, Scopus, PubMed et des bases de données disciplinaires.

Résumé AI en une phrase TLDR

TLDR est un résumé en une phrase généré automatiquement par Semantic Scholar pour les articles, qui résume en très peu de mots les objectifs de la recherche et les résultats principaux, afin que les utilisateurs puissent rapidement déterminer si l’article est pertinent parmi les résultats de recherche.

Actuellement, TLDR couvre près de 60 millions d’articles en informatique, en biologie et en médecine, et est également accessible via une API. Il est généré par des modèles NLP et peut omettre les méthodes, les échantillons et les limites, ne pouvant donc pas remplacer les résumés ou le texte intégral.

Citations à fort impact

Highly Influential Citations utilise l’apprentissage automatique pour analyser le contexte des citations, le nombre de fois où une étude est citée et les relations entre les articles, afin d’identifier les citations ayant une influence significative sur la recherche actuelle. Face à des centaines de références, il permet aux utilisateurs de se concentrer sur les travaux essentiels en premier.

« Haute influence » est une classification de modèles, qui ne correspond pas à la qualité d’un article, à la justesse des conclusions ni à l’obligation de citer. Les habitudes de citation varient considérablement selon les disciplines, et les chercheurs doivent donc évaluer eux-mêmes.

Types de référence et contexte de référence

Certaines pages de mémoires distinguent les types de références en contexte, méthodes et résultats, et affichent des extraits des références correspondantes. Les utilisateurs peuvent ainsi comprendre plus facilement pourquoi un mémoire cite un autre, au lieu de se contenter de voir des chiffres.

La classification automatique peut interpréter à tort le ton de l’auteur et les relations négatives. Lorsqu’il s’agit de juger formellement d’une relation de soutien, d’extension ou de remise en question, il convient de lire le contexte complet du texte original.

Page de détails du mémoire

La page de la thèse présente de manière centralisée le titre, les auteurs, le lieu de publication, l’année, le résumé, le TLDR, les mots-clés, les références, les thèses citées, les graphiques et les recherches connexes. L’utilisateur peut poursuivre le filtrage des documents ultérieurs par année, état du PDF et impact des citations.

Semantic Scholar rassemble diverses sources académiques, ce qui peut parfois entraîner des doublons, des années erronées ou des fusions d’auteurs. Le DOI, le volume et le numéro de page de la revue doivent être vérifiés sur la page de l’éditeur.

Semantic Reader

Semantic Reader est un lecteur de thèses amélioré, utilisable actuellement pour la plupart des articles arXiv. Il comprend la structure des thèses et combine le texte principal avec le réseau académique Semantic Scholar, offrant un sommaire, des fiches de citation, un résumé TLDR ainsi que des informations contextuelles pendant la lecture.

Les lecteurs améliorent principalement l’expérience de lecture en ligne, mais ne garantissent pas que tous les PDF soient accessibles. Un mélange complexe de mise en page, des scans, des matériaux supplémentaires et des textes intégraux soumis à des droits d’auteur exigent encore la source originale.

Soulignement de Goal, Method et Result

Pour la plupart des articles en anglais sur arXiv dans le domaine de l’informatique, Semantic Reader peut mettre en surbrillance automatiquement les objectifs de recherche, les méthodes et les résultats, afin d’aider les utilisateurs à faire une lecture rapide. Les utilisateurs peuvent ajuster le nombre de surbrillants et leur opacité.

L’highlighting est une classification par IA et ne peut pas remplacer la conception de l’étude ni l’interprétation des résultats. Les limites de la recherche, la définition de la ligne de base et les détails statistiques doivent souvent être lus en intégralité.

Définition du contexte

Le lecteur peut fournir des définitions pour les termes et abréviations marqués, basées sur le contexte du document actuel, réduisant ainsi le temps passé à quitter la page pour rechercher des mots. C’est particulièrement pratique lors de la lecture interdisciplinaire.

La définition automatique peut différer de l’usage particulier de l’auteur ; pour les termes clés, il convient de se référer à la définition donnée dans le mémoire, aux références bibliographiques ou à des ouvrages autorisés.

Carte de citation

Lors de la lecture du texte principal, l’utilisateur peut consulter directement les informations de base et le résumé TLDR de l’article cité pour déterminer s’il est nécessaire de l’ouvrir. Si l’article cité est déjà enregistré dans la bibliothèque personnelle, le système peut également mettre en évidence les liens en fonction des activités de recherche personnelles.

Surlignage et notes

Semantic Reader prend en charge l’highlighting et les notes grâce à l’intégration avec Hypothesis. Les utilisateurs ont besoin d’un compte pour enregistrer et gérer leurs annotations, et peuvent également collaborer via le mécanisme de partage d’Hypothesis.

Le contenu des annotations est contrôlé par les données et le niveau de publicité des services tiers. Il convient de vérifier les paramètres de confidentialité avant d’enregistrer des idées de recherche non publiées.

Bibliothèque de documents

Après vous être connecté, vous pouvez enregistrer vos articles dans une bibliothèque en ligne, créer des dossiers personnalisés et exporter des références en masse. Les dossiers publics peuvent être partagés avec des collaborateurs, qui pourront les copier dans leur propre base de données bibliographiques.

Library est adaptée pour découvrir et organiser de manière légère, mais elle ne remplace pas entièrement les gestionnaires de références tels que Zotero ou EndNote en ce qui concerne la gestion des PDF, les plugins de citation et la suppression des doublons.

Research Feeds

Une fois le Research Feed activé dans le dossier Library, le système recommande automatiquement de nouvelles recherches en fonction des articles déjà enregistrés. Il est recommandé officiellement d’ajouter au moins 5 articles pertinents au préalable et de faire des retours sur les recommandations non pertinentes afin d’améliorer la qualité des suggestions.

Il est recommandé de mettre à jour régulièrement à partir du jour suivant, ou de recevoir les mises à jour par e-mail. Plus le thème du dossier est ciblé, plus les résultats sont généralement pertinents ;

Mélanger plusieurs domaines réduit la précision des recommandations.

Thèse, auteur et rappels de recommandation

Les utilisateurs peuvent créer de nouvelles alertes de citation pour leurs articles, suivre les nouveaux articles et citations des auteurs, et recevoir également des e-mails Research Feed. Le tableau de bord de recherche affiche de manière centralisée ces mises à jour de recherche.

La fusion des noms et des informations de l’auteur peut provoquer du bruit de rappel. Avant de s’y intéresser, il convient de vérifier l’institution, le domaine et la page personnelle de l’auteur.

Page personnelle de l’auteur et revendication

Semantic Scholar crée une page d’agrégation pour les auteurs, listant les articles, les citations et les collaborateurs. Les chercheurs peuvent prendre en charge leur propre page d’auteur, gérer l’affectation de leurs articles et recevoir des notifications lorsqu’ils sont cités.

L’évaluation individuelle ne devrait pas se baser uniquement sur le nombre total de citations. La discipline, le stade professionnel, l’ordre des auteurs et la couverture des données influencent tous ces chiffres.

Citer l’exportation

Les pages de mémoires et les résultats de recherche prennent en charge les formats de citation BibTeX, MLA, APA et Chicago, et Library permet également d’exporter en masse. Il est idéal pour intégrer des mémoires déjà trouvés dans le processus d’écriture ou de gestion de la bibliographie.

Le format automatique peut manquer de numéros de page, de numéro de volume ou de caractères spéciaux ; il doit être vérifié par rapport au format du manuscrit original et de la revue avant soumission.

Accès ouvert et PDF

La plateforme affiche l’état d’accès ouvert légal ainsi que les liens PDF disponibles ; certaines informations proviennent de sources telles que Unpaywall. Semantic Scholar ne contourne pas lui-même les barrières de paiement des éditeurs, et ne garantit pas que chaque entrée dispose du texte intégral.

En cas d’impossibilité de téléchargement, on peut utiliser l’abonnement de l’institution affiliée, l’emprunt interbibliothécaire, les archives de l’auteur ou une version légalement accessible.

Politique gratuite

Le site Semantic Scholar, la recherche de articles, la bibliothèque, les flux d’actualités et les principales fonctionnalités de lecture sont gratuits ; il n’existe pas de forfait abonné payant destiné aux chercheurs ordinaires. Le service est géré par l’organisation à but non lucratif de recherche AI2.

Gratuit ne signifie pas qu’il n’y a pas de limitations de débit, d’accès ou de droits d’utilisation des données. Un téléchargement à grande échelle doit utiliser l’API officielle et les ensembles de données, plutôt que d’accéder automatiquement aux pages web.

Academic Graph API

L’API Academic Graph fournit des articles, des auteurs, des citations, des références bibliographiques, des revues et conférences, des vecteurs SPECTER2 ainsi que des informations en accès ouvert. Les développeurs peuvent effectuer des recherches par mots-clés, par ID de corpus ou DOI, et récupérer en masse les champs spécifiés.

Seuls les champs réellement nécessaires doivent être demandés ; il convient d’utiliser la pagination, le cache et l’ajournement pour éviter des appels répétitifs et inutiles en grande quantité.

Recommendations API

L’API de recommandations peut recommander des recherches similaires en se basant sur un ensemble d’articles positifs et, éventuellement, d’articles négatifs, ce qui est idéal pour créer des outils de découverte de littérature, des listes de lecture et des produits de suivi thématique.

Les algorithmes de recommandation ne constituent pas une preuve d’intégralité pour une revue systématique. L’application doit présenter les critères de recommandation, permettre aux utilisateurs de donner leur feedback et conserver un accès à la recherche dans des bases de données spécialisées.

Datasets API

L’API de jeux de données permet la publication en masse, le téléchargement ainsi que la détection des différences incrémentielles du graphe académique de Semantic Scholar, idéale pour que les institutions et les équipes de développement hébergent les données localement et exécutent des requêtes personnalisées.

L’ampleur des données est très importante ; il convient d’évaluer les coûts de stockage, de mise à jour, de licence et de suppression des doublons avant le téléchargement. Les différentes parties des données en masse peuvent avoir leurs propres licences et restrictions sur le texte intégral.

Guide d'utilisation de Semantic Scholar

Terminer une tâche de base

  1. Définir le problème, la période, la région, la priorité des sources et le format de sortie ;
  2. Téléchargez des documents dont vous avez les droits d'utilisation sur Semantic Scholar ou saisissez une question de recherche ;
  3. Commencer par établir un cadre à l’aide de recherches en articles interdisciplinaires, puis compléter les preuves avec des résumés AI en une seule phrase TLDR ;
  4. Il est nécessaire de distinguer les faits de source, les opinions de l’auteur et les inférences de l’IA ;
  5. Vérifier une par une les dates, les chiffres, l’emplacement dans le texte original et les preuves contradictoires ;
  6. Modifier manuellement les conclusions et enregistrer l’heure de vérification avant de les publier ;

Créer des flux de travail professionnels réutilisables

  1. Découper les sujets complexes en quatre catégories de questions : contexte, données, comparaisons et conclusions ;
  2. La recherche combinée de articles interdisciplinaires, les résumés AI en une phrase TLDR et les citations à fort impact forment des étapes de recherche fixes ;
  3. Privilégier les sites officiels, les articles scientifiques, les documents réglementaires et les données brutes ;
  4. Mettre en place une vérification par une deuxième personne pour les conclusions à haut risque ;
  5. Conserver les requêtes, les preuves, les versions et les problèmes non résolus ;
  6. Redémarrer après modification des données et mettre à jour les conclusions ;

Clé API et limites de vitesse

  • La plupart des points d’accès peuvent être accessibles sans authentification, mais les utilisateurs non authentifiés partagent le trafic public, ce qui entraîne une stabilité réduite.
  • Après avoir demandé une APIKey gratuite, les tutoriels officiels indiquent que par défaut, un taux personnel de 1 requête par seconde est accordé, et il est possible de contacter les services pour demander une limite plus élevée en fonction des besoins du projet.
  • En cas d’erreur 429, il faut réduire la vitesse et procéder à un recul exponentiel ;
  • L’APIKey ne doit pas être placée dans un frontend public ou dans un dépôt de code ;

Corpus de recherche ouvert S2ORC

S2ORC est le Semantic Scholar Open Research Corpus, qui fournit des métadonnées de articles, des relations de citation et une partie du texte intégral disponible pour l’analyse de textes scientifiques et la recherche en NLP. Il est actuellement recommandé d’accéder à des versions constamment mises à jour via l’API Datasets.

Les données S2ORC sont soumises à des licences telles que ODC-By 1.0 ; leur utilisation et leur redistribution exigent une citation ainsi que le respect des conditions de chaque partie des données. Open Research Corpus ne signifie pas que l’intégralité des articles puisse être rééditée librement.

Outils de parsing PDF et LaTeX

AI2 a mis en ligne sur GitHub s2orc-doc2json, qui permet d’utiliser des composants tels que Grobid pour convertir des PDF, JATS et LaTeX en structures S2ORC JSON. Il est adapté aux développeurs de recherche souhaitant mettre en place des processus de traitement de documents scientifiques.

Les outils d’analyse nécessitent une installation indépendante des dépendances, et les résultats peuvent également présenter des erreurs dans les formules, les tableaux et les liens vers les références ; ils ne sont donc pas équivalents aux produits de recherche hébergés.

Plateforme de recherche ouverte Semantic Reader

Les recherches liées au Semantic Reader ont donné naissance à des bibliothèques et prototypes tels que PaperMage et PaperCraft, destinés aux développeurs souhaitant étudier des interfaces de lecture intelligente de articles scientifiques. Ces composants présentent certaines méthodes techniques, mais ne constituent pas le code source complet du site Semantic Scholar.

Statut open source

Le service de recherche globale Semantic Scholar, le graphique académique en ligne et l’infrastructure de production ne constituent pas des applications entièrement open source ; cependant, AI2 a rendu publics S2ORC, le analyseur de documents, les composants de recherche Semantic Reader, ainsi que les ressources de données de modèles et d’articles.

Par conséquent, le catalogue doit être indiqué comme « plateforme non entièrement open source, certains données, modèles et outils sont open source ». Il est nécessaire de consulter chaque licence avant d’utiliser un dépôt spécifique.

Différences avec Google Scholar

Google Scholar a une large couverture et excelle à trouver les versions académiques sur les pages web ; Semantic Scholar met davantage l’accent sur des graphes académiques structurés, des TLDR, des citations d’influence, des flux personnalisés et des API ouvertes.

Les résultats des deux méthodes diffèrent selon les bases de données, il est préférable d’utiliser des recherches croisées pour les recherches importantes.

Différences avec ResearchRabbit et Litmaps

Semantic Scholar est une grande infrastructure de recherche et de données ; ResearchRabbit et Litmaps mettent davantage l’accent sur l’exploration de réseaux visuels et la révision structurée à partir d’articles phares.

Les deux derniers utilisent également fréquemment l’API Semantic Scholar ou ses données comme source de base.

Est-ce adapté à une revue systématique ?

  • SemanticScholar convient pour compléter la découverte de articles, le suivi des citations et la recherche par mots-clés, mais ne doit pas être la seule base de données pour les revues systématiques ;
  • Une revue complète doit consigner les requêtes reproductibles, la couverture de plusieurs bases de données, la suppression des doublons, le filtrage et l’évaluation de la qualité ;

À qui s’adresse-t-il ?

  • Étudiants et chercheurs à la recherche de thèses, d’auteurs et de relations de citation ;
  • Utilisateurs qui ont besoin de filtrer rapidement un grand nombre de résultats de recherche ;
  • Chercheurs souhaitant recevoir en continu des recommandations de thèses personnalisées ;
  • Ceux qui lisent des articles arXiv et ont besoin de fiches de citation contextuelle ;
  • Équipe chargée du développement d’outils de recherche académique, de recommandation et de littérature ;
  • Institutions qui utilisent l’Atlas académique ouvert pour la recherche en NLP.

Avantages du produit

  • Couvre plus de 214 millions d’articles interdisciplinaires ;
  • TLDR et les citations à fort impact améliorent l’efficacité du filtrage ;
  • La Bibliothèque, les Flux et les Alertes forment un processus de découverte continue ;
  • Semantic Reader améliore la lecture des articles en ligne ;
  • Le site et les principales API sont gratuits à utiliser ;
  • Données ouvertes, outils d’analyse et composants de recherche abondants.

Restrictions et précautions

  • Les métadonnées du document, la résolution des ambiguïtés concernant les auteurs, les types de citations et les résumés générés par l’IA peuvent tous contenir des erreurs, et la couverture du texte complet n’est pas exhaustive.
  • En bref, les étiquettes d’influence et les recommandations ne peuvent pas remplacer le jugement professionnel.
  • La vitesse par défaut de l’API est limitée, et les données en masse nécessitent une plus grande capacité de stockage ainsi qu’une gestion de la conformité ;
  • La revue systématique doit être combinée avec d’autres bases de données ;

Questions fréquentes

Semantic Scholar est-il gratuit ?

Gratuit. La recherche sur le site, la Bibliothèque, les flux de recherche, les rappels et les principales API ne comportent aucune cotisation de abonnement pour les utilisateurs ordinaires.

Combien d’articles y a-t-il sur Semantic Scholar ?

La page officielle du produit indique actuellement plus de 214 millions d’articles, 2,49 milliards de citations et 79 millions d’auteurs.

TLDR est-il fiable ?

Le TLDR convient à un filtrage rapide, mais étant généré automatiquement par l’IA, il peut omettre des conditions restrictives ; pour une recherche sérieuse, il est nécessaire de lire à la fois le résumé et le texte intégral.

Semantic Scholar propose-t-il une API ?

Trois types d’API sont proposés : Academic Graph, Recommendations et Datasets. La clé API gratuite offre un débit par défaut d’environ 1 requête par seconde.

Est-il possible de télécharger toutes les données ?

Il est possible d’obtenir des données en masse et des mises à jour incrémentielles des graphes académiques via l’API Datasets, mais il faut respecter les restrictions relatives aux licences, aux crédits et à l’utilisation du texte intégral.

Semantic Scholar est-il open source ?

La plateforme en ligne complète n’est pas entièrement open source, mais des ressources telles que S2ORC, le analyseur de documents et les composants de recherche Semantic Reader sont disponibles publiquement.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Semantic Scholar