PREMSGOBOT, notre robot d'indexation
PREMSGOBOT parcourt le Web français pour construire l'index du moteur de recherche Premsgo. Cette page décrit son identité, ses règles de politesse, son périmètre et la marche à suivre pour l'exclure d'un site.
01Identité du robot
- Nom
- PREMSGOBOT
- User-Agent
Mozilla/5.0 (compatible; PREMSGOBOT/4.0; +https://premsgo.fr/bot/; crawl global juillet/aout 2026)- Exploité par
- Premsgo — moteur de recherche français (S.N.A.F.)
- Contact
contact@premsgo.fr- Rôle
- Découverte et indexation des pages publiques francophones
02Règles de politesse
- Mêmes chemins que Googlebot et Bingbot. PREMSGOBOT lit le robots.txt de chaque site et se limite aux zones publiques autorisées aux grands moteurs : ni plus, ni moins.
- Jamais de saturation de serveur. Chaque adresse IP visitée respecte un délai minimum de 3 secondes entre deux requêtes.
- Hébergeurs mutualisés protégés. Sur une IP hébergeant de très nombreux sites (au-delà de 18 000 sites sur une même adresse), le débit est plafonné à 3 connexions par seconde au maximum.
- Zones sensibles ignorées par défaut. Les chemins d'authentification et d'administration —
/login,/connexion,/admin, pages d'inscription — ne sont pas suivis, et aucune tentative d'authentification n'est effectuée. - Identification transparente. Chaque requête porte le User-Agent ci-dessus, qui renvoie vers cette page et indique ouvertement la campagne en cours.
03Périmètre français
PREMSGOBOT est dédié au Web francophone : seules les pages en français sont conservées dans l'index de Premsgo.
Sur un site multilingue, PREMSGOBOT suit en priorité le chemin français (par exemple /fr/). Une page en langue étrangère peut être parcourue, mais elle est écartée de l'index français : la langue de chaque page est vérifiée à l'analyse (attribut lang de la page), et toute page non francophone est automatiquement exclue de l'index. En clair : une version /en/, /de/ ou /es/ n'apparaîtra jamais dans les résultats de Premsgo.
04PREMSGOBOT V4 — architecture de collecte
Tous les sites ne se ressemblent pas. Plutôt qu'une file unique où un site lent bloque tous les autres, PREMSGOBOT répartit le Web français en branches spécialisées, traitées en parallèle par des flottes distinctes et indépendantes.
1Sites groupés chez un même hébergeur
Une part importante du Web français est concentrée sur un petit nombre d'adresses IP mutualisées. Ces sites sont isolés dans une branche dédiée, cadencée à l'adresse IP et non au domaine, afin de ne jamais saturer l'infrastructure d'un hébergeur — même lorsque des dizaines de milliers de sites y résident.
2Sites classiques
Le volume principal : pages servies en HTTP standard, sans dépendance à JavaScript. C'est la branche la plus optimisée, celle dont les débits sont mesurés ci-dessous.
3Sites nécessitant un rendu JavaScript
Les sites dont le contenu n'existe qu'après exécution du code côté navigateur sont détectés puis routés vers une flotte de navigateurs sans interface graphique. Le coût unitaire par page y est bien plus élevé ; les isoler évite qu'ils ne pénalisent le reste de la collecte.
4Sites très lents en préparation
Certains serveurs répondent en 30 secondes, parfois plus d'une minute. Aujourd'hui, ces sites occupent longuement des ressources d'attente. Une quatrième branche leur sera dédiée, avec des délais d'attente élargis et un rythme de repassage propre : ils seront collectés patiemment, sans ralentir les trois autres branches ni être écartés de l'index.
- Processeur16 cœurs
- Mémoire vive128 Go
- Stockage2 × 900 Go NVMe
- Sortie de donnéesCompression
tgzà la volée, évacuation en flux continu vers stockage distant
Le disque local n'est pas un lieu de conservation : les pages collectées sont compressées puis évacuées en continu vers le stockage distant, où elles alimentent les chaînes d'extraction et d'indexation. La collecte n'est donc jamais limitée par la capacité disque de la machine.
| Régime nominal retenu | 978 pages / seconde à 31 % de charge processeur |
| Débit de pointe atteint | 1 600 pages / seconde — hors plage d'exploitation, voir ci-dessous |
| Charge processeur à 448 p/s | 8,4 % — charge moyenne système 1,93 sur 16 cœurs |
| Période de mesure | Juillet 2026 |
| Périmètre | Web francophone, pages HTTP sans dépendance JavaScript |
| Unité comptabilisée | Page entièrement traitée, et non simplement téléchargée |
| Portée du chiffre | Par machine. L'architecture est conçue pour se démultiplier horizontalement : le débit total est fonction du nombre de machines déployées |
Pourquoi le régime nominal est délibérément plafonné. Au-delà d'un certain nombre de connexions simultanées, le débit affiché continue de monter, mais les échecs de négociation TLS se multiplient et les pages perdues repartent en file d'attente. Le gain est alors apparent : il est payé en qualité de moisson. Premsgo exploite donc la partie de la courbe où le débit est durable, et non le point où le compteur est le plus flatteur. Le chiffre de pointe est publié par transparence, pas comme régime de fonctionnement.
La charge processeur est ici la donnée la plus significative : à débit comparable, l'optimisation menée en juillet 2026 a fait passer la consommation processeur de 78 % à 8,4 %. La collecte n'est plus limitée par le calcul, mais par le réseau et par les règles de politesse — ce qui est la situation recherchée.
Un débit de collecte n'a de sens qu'accompagné de sa définition. Ci-dessous, la totalité des opérations comprises dans chaque page comptabilisée.
| Étape | Opération réalisée |
|---|---|
| Politesse | Lecture et application du robots.txt, respect des délais par adresse IP |
| Transport | Résolution DNS, connexion, négociation TLS, téléchargement HTTP |
| Décodage | Détection de l'encodage d'origine et conversion intégrale en UTF-8 |
| Qualification | Classement de la réponse : page valide, redirection, page nécessitant JavaScript, page de blocage anti-robot, page de domaine en attente (« parking »), échec DNS, échec TLS, erreur serveur, limitation de débit, dépassement de délai |
| Remise | Écriture de la page en UTF-8 et transmission à la chaîne d'indexation |
L'analyse du contenu — extraction du texte, des métadonnées, des liens et détermination de la langue — n'est pas réalisée pendant la collecte. Le collecteur a une fonction unique et strictement délimitée : obtenir la page, la qualifier, la restituer en UTF-8. Cette séparation des rôles est un choix d'architecture : elle permet de rejouer et de faire évoluer l'analyse sans jamais recommencer la collecte.
Le débit provient du parallélisme entre des milliers de sites distincts, jamais de la sollicitation intensive d'un serveur unique : les règles de politesse de la section 02 s'appliquent intégralement à chaque site pris isolément.
| Solution | Débit couramment rapporté |
|---|---|
| Apache Nutch (Java, distribué) | De 10 à 300 pages/s, réparties sur un cluster de plusieurs machines |
| Heritrix (Java, archivage patrimonial) | De 10 à 100 pages/s par instance ; conçu pour la fidélité d'archivage, pas pour le débit |
| Scrapy (collecte ciblée) | De 100 à 500 pages/s au maximum sur une machine |
| PREMSGOBOT V4 — branche sites classiques | 978 pages/s par machine en régime nominal, conversion UTF-8 et qualification incluses (pointe mesurée : 1 600 pages/s) |
Les chiffres des solutions open source sont des ordres de grandeur usuellement observés et dépendent fortement du matériel, du réseau et de la profondeur d'analyse. Ils sont donnés à titre de repère, non comme un banc d'essai contradictoire : seule une mesure sur matériel identique et corpus identique constituerait une comparaison rigoureuse.
| Principe | Mise en œuvre |
|---|---|
| Politesse à la granularité du site | Là où la plupart des collecteurs appliquent un simple délai par nom de domaine, PREMSGOBOT raisonne conjointement par adresse IP et par site : plusieurs sites hébergés sur une même machine ne peuvent pas se cumuler pour la saturer |
| Collecte et analyse séparées | Le collecteur ne réalise aucune analyse de contenu. C'est ce qui lui évite d'être limité par le calcul — l'écueil des collecteurs qui analysent chaque page à la volée |
| Rendu JavaScript sélectif | Les pages nécessitant un navigateur sont détectées lors de la collecte HTTP, puis routées vers une flotte Playwright dédiée. Aucun rendu systématique : le coût énergétique et matériel d'un navigateur n'est engagé que là où il est indispensable |
| Suivi d'état compact | Un octet par page. Une campagne de 20 millions de pages tient son état complet dans 20 Mo, ce qui autorise une reprise exacte après interruption, sans reprise à zéro ni recollecte inutile |
| Mesure avant optimisation | Aucune modification n'est déployée sans mesure préalable et sans test de non-régression. Les gains annoncés ici sont des écarts constatés en production, pas des estimations |
Ce que Premsgo n'a pas encore. La collecte fonctionne aujourd'hui sur une machine ; la distribution sur plusieurs machines est le chantier en cours. La déduplication de contenu entre sites distincts et la coordination de politesse entre nœuds restent à construire. Ces limites sont publiées au même titre que les résultats.
Un choix technologique assumé. Premsgo ne s'appuie sur aucune solution générique d'indexation du marché. Chaque étape de la chaîne — collecte, stockage, dictionnaire, index, calcul de pertinence, restitution — a été dotée de l'outil le plus adapté et le plus performant disponible en 2026, sélectionné sur mesure et non par défaut.
Le socle de correspondance de l'index repose notamment sur LMDB, moteur clé-valeur transactionnel considéré par de nombreux spécialistes comme la base de données en lecture la plus rapide au monde : accès mémoire directs de l'ordre de la microseconde, sans serveur intermédiaire, sans machine virtuelle, sans latence réseau. C'est cette architecture — et l'absence délibérée de couches inutiles — qui explique les temps de réponse observés.
Europe 2027
05Déploiement européen — début 2027
Après le Web français, Premsgo prépare l'extension de son index à l'ensemble du Web européen, avec une ouverture prévue pour le début 2027.
Les chiffres de la section 04 sont donnés par machine. En régime nominal, une machine traite de l'ordre de 80 millions de pages par jour. L'architecture étant conçue pour se démultiplier horizontalement, une flotte de quelques dizaines de machines porte la capacité à quatre milliards de pages par jour — de quoi maintenir un index européen frais, complet et souverain, dans le respect des mêmes règles de politesse qu'aujourd'hui.
Ce facteur d'échelle n'est pas une projection abstraite : il découle directement du débit mesuré et du nombre de machines déployées. Le passage à la distribution multi-machines constitue le chantier technique en cours.
Ce déploiement s'inscrit dans une démarche de souveraineté numérique européenne : un moteur de recherche indépendant, opéré depuis la France, valorisant les données et les services du continent. Collectivités, institutions et investisseurs intéressés par ce projet peuvent nous contacter.
06Exclure votre site
Pour empêcher PREMSGOBOT de parcourir tout ou partie de votre site, ajoutez ces lignes à votre fichier robots.txt :
User-agent: PREMSGOBOT Disallow: /
Pour n'exclure qu'une partie du site, remplacez / par le chemin concerné (par exemple Disallow: /prive/). Les modifications sont prises en compte au passage suivant du robot.
Pour toute demande de retrait immédiat ou tout signalement, écrivez-nous : chaque message est traité rapidement.
Une question sur PREMSGOBOT, un projet de déploiement, ou un comportement à signaler ?
Écrivez à contact@premsgo.fr
Annuaire Français, présent sur le Web depuis 1996, accompagne depuis plus de 30 ans la visibilité des entreprises françaises.