Le fichier sitemap.xml est un fichier qui contient la liste de toutes les pages d'un site internet. Il est toujours au format XML (eXtensible Markup Language). Il a une structure précise, définie par le protocole sitemaps.org, un standard commun à tous les moteurs de recherche. Il est plus simple de ne pas changer le nom et d'utiliser le nom de fichier « sitemap.xml », mais le nom du fichier peut être changé par le propriétaire du site, qui doit alors indiquer le nouveau nom dans le fichier robots.txt. Pensez aussi à envoyer le fichier sitemap.xml, une fois qu'il a été créé, aux différentes plateformes pour webmasters (Google Search Console, Bing Webmaster Tools…).
Le fichier sitemap permet aux moteurs de recherche de connaître plus rapidement la liste des pages d'un site, en particulier les dernières pages ajoutées. C'est pourquoi vous devriez toujours avoir un fichier sitemap à jour sur votre site web. Un fichier sitemap à jour améliore la découverte de vos pages, et donc votre référencement naturel.
Il est également recommandé de déclarer votre sitemap dans le fichier robots.txt, placé lui aussi à la racine du site, avec une ligne du type Sitemap: https://www.mon-site.fr/sitemap.xml. Tous les moteurs de recherche sérieux lisent cette ligne.
Le site unsitemap.com est conçu pour scanner toutes les pages d'un site web à partir de l'adresse principale de votre site. Il est capable de scanner jusqu'à 5 000 pages par analyse. En premier lieu, les pages sont vérifiées pour s'assurer qu'elles ne renvoient pas d'erreur 404 : le cas échéant, les pages en erreur vous sont indiquées, ainsi que la page de votre site sur laquelle le lien fautif a été trouvé. Ensuite, unsitemap.com génère un fichier XML, que vous pouvez télécharger en cliquant sur un bouton à la fin du processus. Il ne vous reste plus qu'à déposer le fichier à la racine de votre site internet, puis à le soumettre aux différentes plateformes prévues pour les webmasters. Générer le sitemap de manière automatique va vous faire gagner du temps.
Le robot suit uniquement les liens internes de votre nom de domaine et ne modifie jamais votre site : il se contente de lire vos pages publiques, exactement comme le ferait un moteur de recherche. Les erreurs 403 sont volontairement ignorées, car elles correspondent le plus souvent à des zones protégées par mot de passe.