Friday, 28 August 2026 | Mise à jour quotidienne L'intelligence artificielle au service des constructeurs

Pages des articles sur Hugging Face : Articles quotidiens, liens arXiv et métadonnées des modèles

  • Une page d’article sur Hugging Face se trouve à l’adresse huggingface.co/papers/<identifiant-arXiv>. Remplacez arxiv.org/abs/ pour huggingface.co/papers/ dans n’importe quelle URL arXiv pour accéder directement à la page correspondante.
  • huggingface.co/papers est la rubrique « Articles quotidiens » — un flux chronologique trié par votes positifs. La soumission d’un article à ce flux exige d’être un auteur vérifié de cet article.
  • Les dépôts apparaissent dans la section « Modèles citant cet article » lorsque le lien arXiv ou une balise arxiv:<identifiant> est présente dans le fichier README.mdREADME.md du dépôt. Les résultats des benchmarks sont stockés dans le bloc model-index du même fichier.
  • Citez la version arXiv ou celle publiée dans une revue, et non la page Hugging Face. Cette page est un miroir enrichi d’une couche sociale et de métadonnées.

Une page d’article sur Hugging Face se trouve à l’adresse huggingface.co/papers/<identifiant-arXiv> (par exemple /papers/2310.06825, le Mistral 7B pour un article). Elle reprend le résumé arXiv et ajoute des votes positifs, des commentaires, des auteurs vérifiés, ainsi que des listes automatiquement générées des modèles, jeux de données et Spaces qui citent l’article. huggingface.co/papers elle-même est « Articles quotidiens », un flux de soumissions sélectionnées.

Deux autres interprétations courantes de cette requête : les articles publiés directement par l’équipe de Hugging Face, et les mécanismes de métadonnées qui relient un article aux poids téléchargeables. Ces deux sujets sont abordés ci-dessous.

Que contient réellement une page d’article ?

Section Qu’est-ce que c’est Qui en a le contrôle ?
Abstrait Texte en miroir, accompagné d’un lien vers le PDF arXiv arXiv
Votes positifs Un indicateur de popularité. Pas une évaluation ni une validation expérimentale. Tout compte connecté
Auteurs Noms des auteurs, liés à leurs profils sur le Hub dès lors que leur paternité est revendiquée et confirmée Hugging Face vérifie les revendications d’auteur
Modèles / Jeux de données / Spaces citant cet article Déduits automatiquement des fiches de dépôts faisant référence à l’identifiant arXiv Propriétaires de dépôts
Onglet Communauté Commentaires organisés en fils de discussion, souvent avec des réponses des auteurs Tout compte connecté

En pratique, une page d’article existe dès que l’article a été soumis à « Articles quotidiens » ou référencé depuis un dépôt du Hub. Si vous suivez un lien arXiv et aboutissez sur une erreur 404, personne n’a encore établi ce lien avec le Hub.

« Articles quotidiens » versus pages d’articles

Il s’agit d’objets distincts. La page d’article est permanente et identifiée par l’identifiant arXiv. « Articles quotidiens » est le flux chronologique situé à l’adresse huggingface.co/papers, où les soumissions communautaires sont regroupées par jour et classées principalement selon le nombre de votes positifs.

La soumission est restreinte : vous devez généralement être un auteur vérifié de l’article pour le proposer au flux, et un quota limite le nombre d’articles que vous pouvez soumettre. Ce quota exact et l’heure limite de soumission ont varié au fil du temps ; consultez donc l’avis affiché sur le formulaire de soumission plutôt que de vous fier à une valeur trouvée dans un billet de blog.

Schémas d’URL utiles à connaître

URL Ce que vous obtenez
huggingface.co/papers Les « Articles quotidiens » d’aujourd’hui
huggingface.co/papers?date=2026-03-04 Le fil d’actualités de cette journée précise
huggingface.co/papers/2310.06825 La page dédiée à cet article sur arXiv
huggingface.co/papers?q=speculative+decoding Rechercher parmi les articles indexés

La date et les paramètres de recherche sont suffisamment stables pour être enregistrés en tant que favori. Les onglets de l’index (tendances, vues hebdomadaires, vues mensuelles) ont été réorganisés plusieurs fois ; naviguez donc vers ceux-ci directement depuis la page elle-même.

Comment les modèles sont associés à un article : README.md et model-index

Chaque dépôt sur le Hub — modèle, jeu de données ou Space — comporte un fichier README.md à sa racine. Ce fichier est constitue la fiche descriptive (« card »). Il commence par un bloc YAML délimité par deux lignes --- ; le Hub analyse ce bloc YAML afin d’en extraire des métadonnées structurées, tandis que tout le contenu situé après la ligne de fermeture est rendu au format Markdown.

Accéder à la section « Modèles citant cet article »

Deux mécanismes sont disponibles, et vous pouvez utiliser les deux :

  • Insérez l’URL arXiv brute (https://arxiv.org/abs/2310.06825) dans le corps de la README.md, généralement au sein du bloc de citations. Le Hub extrait automatiquement les liens arXiv présents dans les fiches descriptives.
  • Ajoutez explicitement le tag arxiv:2310.06825 à la liste des tags dans l’en-tête YAML. Il s’agit de la forme non ambiguë, qui permet également de filtrer les dépôts selon ce tag.

Rapporter les résultats numériques de l’article à l’aide de « model-index »

model-index est une clé YAML située dans le même en-tête YAML. Elle permet de rendre les résultats d’évaluation auto-déclarés exploitables par machine, plutôt que de les laisser sous forme de tableau Markdown impossible à interroger. Il s’agit d’un tableau de modèles, chacun comportant une liste de résultats, chaque résultat associant une tâche, un jeu de données et une ou plusieurs métriques :

---
license: apache-2.0
language:
- en
library_name: transformers
pipeline_tag: text-generation
base_model: mistralai/Mistral-7B-v0.3
datasets:
- squad
tags:
- arxiv:2310.06825
model-index:
- name: my-paper-reproduction
  results:
  - task:
      type: question-answering
      name: Question Answering
    dataset:
      type: squad
      name: SQuAD v1.1
      split: validation
    metrics:
    - type: exact_match
      value: 87.3
      name: Exact Match
      verified: false
---

Trois détails susceptibles de prêter à confusion. La clé est écrite avec un trait d’union (model-indexmodel-index model_index). task.type doit correspondre à un identifiant de tâche valide sur le Hub, tel que text-generation ou question-answering; dans le cas contraire, le bloc est simplement ignoré, sans générer d’erreur explicite. Enfin, verified: false constitue la valeur par défaut honnête : seuls les résultats vérifiés proviennent des propres exécutions d’évaluation menées par Hugging Face, et non de simples affirmations de votre part.

Si votre fichier YAML est mal formé, la fiche descriptive s’affichera tout de même, mais les métadonnées disparaîtront silencieusement. Vérifiez la page du dépôt après avoir validé vos modifications, et comparez les spécifications affichées de votre fiche avec une référence fiable, comme la base de données des modèles Convly afin de confirmer que les champs attendus y figurent bien.

Reproduire localement le modèle décrit dans un article

Avant de télécharger 30 Go de poids, vérifiez si le modèle est compatible avec votre carte graphique. Faites passer la valeur correspondante dans le Calculateur de VRAMcalculateur de consommation VRAM tableau des besoins en VRAM par modèle. Le résultat phare d’un article est souvent obtenu sur une configuration 8×H100 ; le point de contrôle (checkpoint) fourni sur la page de l’article peut toutefois correspondre à une version beaucoup plus légère, issue d’une distillation.

Les outils sont regroupés dans un seul paquet Python, disponible sur les trois plateformes :

pip install -U huggingface_hub
hf auth login
hf download mistralai/Mistral-7B-Instruct-v0.3 --include "*.safetensors" "*.json" "tokenizer*"

L’interface en ligne de commande (CLI) a été renommée de huggingface-cli sur hf lors d’une mise à jour publiée en 2025 de huggingface_hubhuggingface_hub huggingface-cli download et huggingface-cli loginhuggingface-cli hf hf hf --help ou pip show huggingface_hub pour identifier la version installée.

Linux

Le cache utilise par défaut le chemin ~/.cache/huggingface/hub. Vous pouvez le déplacer en définissant la variable d’environnement export HF_HOME=/mnt/models/hf avant d’exécuter toute commande. Pour les dépôts volumineux, installez le module dédié via pip install hf_transfer et export HF_HUB_ENABLE_HF_TRANSFER=1 augmente considérablement le débit sur les connexions rapides. C’est dans ce contexte que les noyaux CUDA personnalisés fournis avec le code d’un article se compileront effectivement ; voir Choix de GPU pour les LLM locaux si vous sélectionnez du matériel destiné à reproduire des travaux de recherche.

macOS

Même chemin de cache, ~/.cache/huggingface/hub. Sur Apple Silicon, le backend MPS de PyTorch prend en charge l’inférence standard des transformeurs, mais les dépôts associés à un article qui dépendent d’extensions CUDA écrites manuellement ne se compileront pas du tout. Dans ce cas, la solution pragmatique consiste à effectuer une conversion quantifiée au format GGUF via Ollama — vous perdez alors l’exactitude numérique par rapport à l’article, aussi ne devez-vous pas la présenter comme une reproduction.

Windows

Le cache utilise par défaut le chemin C:\Users\\.cache\huggingface\hub. Définissez un autre emplacement dans PowerShell à l’aide de la commande $env:HF_HOME="D:\hf" pour la session en cours, ou via les Propriétés système pour une configuration permanente. En l’absence du mode Développeur ou d’un interpréteur de commandes élargi (« elevated shell »), le cache du Hub ne peut pas créer de liens symboliques et recourt alors à la duplication des fichiers, ce qui consomme davantage d’espace disque et affiche un avertissement à chaque téléchargement ; HF_HUB_DISABLE_SYMLINKS_WARNING=1 permet de supprimer ce message sans modifier le comportement sous-jacent. De nombreux dépôts de recherche partent du principe qu’un interpréteur de commandes Unix est disponible, aussi WSL2 est généralement moins contraignant que Windows natif dès lors que l’on dépasse le simple usage d’inférence.

Plateforme Cache par défaut Principal piège
Linux ~/.cache/huggingface/hub Aucun ; l’environnement de référence
macOS ~/.cache/huggingface/hub Pas de CUDA ; les noyaux personnalisés ne se compileront pas
Windows C:\Users\\.cache\huggingface\hub Le recours aux liens symboliques entraîne la duplication des fichiers

Articles publiés par Hugging Face lui-même

Les deux articles les plus cités sont faciles à identifier :

Article Identifiant arXiv
Transformers : State-of-the-Art Natural Language Processing 1910.03771
DistilBERT, une version distillée de BERT 1910.01108

Les travaux ultérieurs — les articles sur l’alignement Zephyr, celui présentant le jeu de données FineWeb, ou encore la série SmolLM — sont mieux localisés directement depuis leur source plutôt que via un identifiant mémorisé. Ouvrez le profil de l’organisation concernée (par exemplehuggingface.co/HuggingFaceTB) et utilisez son onglet « Papers », ou bien ouvrez la fiche modèle correspondante et consultez son bloc de citations. Ces deux méthodes vous fournissent la référence canonique actuelle ; une liste codée en dur dans un article ne le fait pas.

Récupérer les données d’un article par programmation

La méthode stable et documentée consiste à utiliser l’API classique du Hub, qui fonctionne parce que arxiv:<identifiant> est une étiquette normale :

curl "https://huggingface.co/api/models?filter=arxiv:2310.06825"

Cela renvoie tous les dépôts de modèles déclarant cet article. Il existe également un point de terminaison JSON derrière le flux « Daily Papers », mais il n’est pas documenté et ne comporte aucune garantie de compatibilité — parfaitement acceptable pour un script personnel de veille, mais inapproprié comme fondement d’un produit. Si vous avez besoin de métadonnées d’articles pérennes, procédez à un « scraping » depuis l’API officielle d’arXiv et associez les résultats à l’aide de l’identifiant.

Questions fréquemment posées

Une page d’article sur Hugging Face est-elle identique à la page arXiv correspondante ?

Non. Elle reprend uniquement le résumé (abstract) et fournit un lien vers le PDF arXiv, mais il s’agit d’un objet distinct disposant de ses propres votes positifs, commentaires et liens vers des dépôts (repos). Pour les références bibliographiques, utilisez toujours l’entrée arXiv ou la version publiée dans une revue scientifique. Citer l’URL Hugging Face dans une bibliographie constitue une erreur fréquente dans les prépublications, et les relecteurs la remarquent systématiquement.

Comment faire apparaître mon modèle dans la section « Modèles citant cet article » ?

Ajoutez le lien arXiv à la section README.md, ou ajoutez arxiv:<identifiant> à la liste des tags dans la partie YAML front matter de la fiche. Cette liste est générée à partir des métadonnées de la fiche, donc elle est mise à jour après validation de la fiche (commit), et non lors du téléchargement des poids. Si elle n’apparaît pas, la cause la plus fréquente est une erreur de syntaxe YAML dans la partie front matter.

Puis-je soumettre l’article d’un tiers au flux « Daily Papers » ?

Généralement non — la soumission est réservée aux auteurs vérifiés de l’article. Vous pouvez toutefois voter pour une page existante, y ajouter des commentaires, la partager, et inclure l’identifiant arXiv dans un dépôt que vous possédez afin qu’une page d’article soit automatiquement créée. Les revendications d’auteur sont effectuées depuis la page de l’article et confirmées par Hugging Face.

Les votes positifs signifient-ils qu’un article est de qualité ?

Cela signifie simplement qu’il a retenu l’attention le jour même de sa publication. Ce flux valorise autant le moment de la publication, une liste d’auteurs reconnus et un titre percutant que les résultats eux-mêmes. Traitez les affirmations relatives aux performances comme non vérifiées tant que vous ne les avez pas confirmées indépendamment — un Classement des grands modèles linguistiques (LLM) constitue une base de comparaison plus fiable qu’un tableau présenté dans l’article lui-même, et les Calculateur de coûts d’API sont plus utiles que les allégations d’efficacité figurant dans un article lorsque vous décidez concrètement quel modèle déployer.

D’où proviennent les chiffres d’évaluation affichés sur la fiche d’un modèle ?

À partir du bloc model-index de cette fiche modèle, README.mdque le propriétaire du dépôt rédige manuellement. Ces métriques sont auto-déclarées, sauf si elles portent la mention verified: true, ce qui indique qu’Hugging Face a effectué l’évaluation. Traitez les entrées non vérifiées comme toute donnée figurant dans un préprint : plausible, non auditée, et méritant d’être réexécutée sur vos propres données.

Rédigé par Mustafa Ihsan

Mustafa Ihsan est le fondateur et rédacteur en chef de Convly.ai. Il a conçu et maintient la base de données en temps réel des modèles IA du site, son indice de rapport prix/performance, ainsi que ses calculateurs gratuits pour les besoins en VRAM, les coûts d’API et l’économie de l’hébergement local. Il écrit notamment sur la tarification des modèles, les résultats de benchmarks et le matériel requis pour exécuter localement des modèles d’intelligence artificielle, privilégiant systématiquement les données mesurées aux affirmations des éditeurs.

Défiler vers le haut
Featured on There's An AI For That