Le moteur de recherche franco-français

PREMSGOBOT, notre robot d'indexation

PREMSGOBOT parcourt le Web français pour construire l'index du moteur de recherche Premsgo. Cette page décrit son identité, ses règles de politesse, son périmètre et la marche à suivre pour l'exclure d'un site.

Campagne en cours : crawl global — juillet / août 2026 Objectif : 525 millions de pages · jusqu'au 15 août 2026

01Identité du robot

Nom
PREMSGOBOT
User-Agent
Mozilla/5.0 (compatible; PREMSGOBOT/4.0; +https://premsgo.fr/bot/; crawl global juillet/aout 2026)
Exploité par
Premsgo — moteur de recherche français (S.N.A.F.)
Contact
contact@premsgo.fr
Rôle
Découverte et indexation des pages publiques francophones

02Règles de politesse

03Périmètre français

PREMSGOBOT est dédié au Web francophone : seules les pages en français sont conservées dans l'index de Premsgo.

Sur un site multilingue, PREMSGOBOT suit en priorité le chemin français (par exemple /fr/). Une page en langue étrangère peut être parcourue, mais elle est écartée de l'index français : la langue de chaque page est vérifiée à l'analyse (attribut lang de la page), et toute page non francophone est automatiquement exclue de l'index. En clair : une version /en/, /de/ ou /es/ n'apparaîtra jamais dans les résultats de Premsgo.

04PREMSGOBOT V4 — architecture de collecte

Tous les sites ne se ressemblent pas. Plutôt qu'une file unique où un site lent bloque tous les autres, PREMSGOBOT répartit le Web français en branches spécialisées, traitées en parallèle par des flottes distinctes et indépendantes.

1Sites groupés chez un même hébergeur

Une part importante du Web français est concentrée sur un petit nombre d'adresses IP mutualisées. Ces sites sont isolés dans une branche dédiée, cadencée à l'adresse IP et non au domaine, afin de ne jamais saturer l'infrastructure d'un hébergeur — même lorsque des dizaines de milliers de sites y résident.

2Sites classiques

Le volume principal : pages servies en HTTP standard, sans dépendance à JavaScript. C'est la branche la plus optimisée, celle dont les débits sont mesurés ci-dessous.

3Sites nécessitant un rendu JavaScript

Les sites dont le contenu n'existe qu'après exécution du code côté navigateur sont détectés puis routés vers une flotte de navigateurs sans interface graphique. Le coût unitaire par page y est bien plus élevé ; les isoler évite qu'ils ne pénalisent le reste de la collecte.

4Sites très lents en préparation

Certains serveurs répondent en 30 secondes, parfois plus d'une minute. Aujourd'hui, ces sites occupent longuement des ressources d'attente. Une quatrième branche leur sera dédiée, avec des délais d'attente élargis et un rythme de repassage propre : ils seront collectés patiemment, sans ralentir les trois autres branches ni être écartés de l'index.

Machine de mesure — serveur unique
  • Processeur16 cœurs
  • Mémoire vive128 Go
  • Stockage2 × 900 Go NVMe
  • Sortie de donnéesCompression tgz à la volée, évacuation en flux continu vers stockage distant

Le disque local n'est pas un lieu de conservation : les pages collectées sont compressées puis évacuées en continu vers le stockage distant, où elles alimentent les chaînes d'extraction et d'indexation. La collecte n'est donc jamais limitée par la capacité disque de la machine.

Débit mesuré par machine — branche « sites classiques »
Régime nominal retenu978 pages / seconde à 31 % de charge processeur
Débit de pointe atteint1 600 pages / seconde — hors plage d'exploitation, voir ci-dessous
Charge processeur à 448 p/s8,4 % — charge moyenne système 1,93 sur 16 cœurs
Période de mesureJuillet 2026
PérimètreWeb francophone, pages HTTP sans dépendance JavaScript
Unité comptabiliséePage entièrement traitée, et non simplement téléchargée
Portée du chiffrePar machine. L'architecture est conçue pour se démultiplier horizontalement : le débit total est fonction du nombre de machines déployées

Pourquoi le régime nominal est délibérément plafonné. Au-delà d'un certain nombre de connexions simultanées, le débit affiché continue de monter, mais les échecs de négociation TLS se multiplient et les pages perdues repartent en file d'attente. Le gain est alors apparent : il est payé en qualité de moisson. Premsgo exploite donc la partie de la courbe où le débit est durable, et non le point où le compteur est le plus flatteur. Le chiffre de pointe est publié par transparence, pas comme régime de fonctionnement.

La charge processeur est ici la donnée la plus significative : à débit comparable, l'optimisation menée en juillet 2026 a fait passer la consommation processeur de 78 % à 8,4 %. La collecte n'est plus limitée par le calcul, mais par le réseau et par les règles de politesse — ce qui est la situation recherchée.

Un débit de collecte n'a de sens qu'accompagné de sa définition. Ci-dessous, la totalité des opérations comprises dans chaque page comptabilisée.

Ce que comprend une page comptabilisée
ÉtapeOpération réalisée
PolitesseLecture et application du robots.txt, respect des délais par adresse IP
TransportRésolution DNS, connexion, négociation TLS, téléchargement HTTP
DécodageDétection de l'encodage d'origine et conversion intégrale en UTF-8
QualificationClassement de la réponse : page valide, redirection, page nécessitant JavaScript, page de blocage anti-robot, page de domaine en attente (« parking »), échec DNS, échec TLS, erreur serveur, limitation de débit, dépassement de délai
RemiseÉcriture de la page en UTF-8 et transmission à la chaîne d'indexation

L'analyse du contenu — extraction du texte, des métadonnées, des liens et détermination de la langue — n'est pas réalisée pendant la collecte. Le collecteur a une fonction unique et strictement délimitée : obtenir la page, la qualifier, la restituer en UTF-8. Cette séparation des rôles est un choix d'architecture : elle permet de rejouer et de faire évoluer l'analyse sans jamais recommencer la collecte.

Le débit provient du parallélisme entre des milliers de sites distincts, jamais de la sollicitation intensive d'un serveur unique : les règles de politesse de la section 02 s'appliquent intégralement à chaque site pris isolément.

Ordre de grandeur — collecteurs open source de référence
SolutionDébit couramment rapporté
Apache Nutch (Java, distribué)De 10 à 300 pages/s, réparties sur un cluster de plusieurs machines
Heritrix (Java, archivage patrimonial)De 10 à 100 pages/s par instance ; conçu pour la fidélité d'archivage, pas pour le débit
Scrapy (collecte ciblée)De 100 à 500 pages/s au maximum sur une machine
PREMSGOBOT V4 — branche sites classiques978 pages/s par machine en régime nominal, conversion UTF-8 et qualification incluses (pointe mesurée : 1 600 pages/s)

Les chiffres des solutions open source sont des ordres de grandeur usuellement observés et dépendent fortement du matériel, du réseau et de la profondeur d'analyse. Ils sont donnés à titre de repère, non comme un banc d'essai contradictoire : seule une mesure sur matériel identique et corpus identique constituerait une comparaison rigoureuse.

Principes d'architecture
PrincipeMise en œuvre
Politesse à la granularité du siteLà où la plupart des collecteurs appliquent un simple délai par nom de domaine, PREMSGOBOT raisonne conjointement par adresse IP et par site : plusieurs sites hébergés sur une même machine ne peuvent pas se cumuler pour la saturer
Collecte et analyse séparéesLe collecteur ne réalise aucune analyse de contenu. C'est ce qui lui évite d'être limité par le calcul — l'écueil des collecteurs qui analysent chaque page à la volée
Rendu JavaScript sélectifLes pages nécessitant un navigateur sont détectées lors de la collecte HTTP, puis routées vers une flotte Playwright dédiée. Aucun rendu systématique : le coût énergétique et matériel d'un navigateur n'est engagé que là où il est indispensable
Suivi d'état compactUn octet par page. Une campagne de 20 millions de pages tient son état complet dans 20 Mo, ce qui autorise une reprise exacte après interruption, sans reprise à zéro ni recollecte inutile
Mesure avant optimisationAucune modification n'est déployée sans mesure préalable et sans test de non-régression. Les gains annoncés ici sont des écarts constatés en production, pas des estimations

Ce que Premsgo n'a pas encore. La collecte fonctionne aujourd'hui sur une machine ; la distribution sur plusieurs machines est le chantier en cours. La déduplication de contenu entre sites distincts et la coordination de politesse entre nœuds restent à construire. Ces limites sont publiées au même titre que les résultats.

Un choix technologique assumé. Premsgo ne s'appuie sur aucune solution générique d'indexation du marché. Chaque étape de la chaîne — collecte, stockage, dictionnaire, index, calcul de pertinence, restitution — a été dotée de l'outil le plus adapté et le plus performant disponible en 2026, sélectionné sur mesure et non par défaut.

Le socle de correspondance de l'index repose notamment sur LMDB, moteur clé-valeur transactionnel considéré par de nombreux spécialistes comme la base de données en lecture la plus rapide au monde : accès mémoire directs de l'ordre de la microseconde, sans serveur intermédiaire, sans machine virtuelle, sans latence réseau. C'est cette architecture — et l'absence délibérée de couches inutiles — qui explique les temps de réponse observés.

10 millionsNoms de domaines .fr (AFNIC)
30 millionspages indexées par jour — crawl français
525 millionspages sur la campagne juillet/août 2026
4 milliardspages / jour — flotte en déploiement de masse
Europe 2027

05Déploiement européen — début 2027

Après le Web français, Premsgo prépare l'extension de son index à l'ensemble du Web européen, avec une ouverture prévue pour le début 2027.

Les chiffres de la section 04 sont donnés par machine. En régime nominal, une machine traite de l'ordre de 80 millions de pages par jour. L'architecture étant conçue pour se démultiplier horizontalement, une flotte de quelques dizaines de machines porte la capacité à quatre milliards de pages par jour — de quoi maintenir un index européen frais, complet et souverain, dans le respect des mêmes règles de politesse qu'aujourd'hui.

Ce facteur d'échelle n'est pas une projection abstraite : il découle directement du débit mesuré et du nombre de machines déployées. Le passage à la distribution multi-machines constitue le chantier technique en cours.

Ce déploiement s'inscrit dans une démarche de souveraineté numérique européenne : un moteur de recherche indépendant, opéré depuis la France, valorisant les données et les services du continent. Collectivités, institutions et investisseurs intéressés par ce projet peuvent nous contacter.

06Exclure votre site

Pour empêcher PREMSGOBOT de parcourir tout ou partie de votre site, ajoutez ces lignes à votre fichier robots.txt :

User-agent: PREMSGOBOT
Disallow: /

Pour n'exclure qu'une partie du site, remplacez / par le chemin concerné (par exemple Disallow: /prive/). Les modifications sont prises en compte au passage suivant du robot.

Pour toute demande de retrait immédiat ou tout signalement, écrivez-nous : chaque message est traité rapidement.

Une question sur PREMSGOBOT, un projet de déploiement, ou un comportement à signaler ?
Écrivez à contact@premsgo.fr

Annuaire Français, présent sur le Web depuis 1996, accompagne depuis plus de 30 ans la visibilité des entreprises françaises.