{"id":650,"date":"2011-04-29T15:27:33","date_gmt":"2011-04-29T13:27:33","guid":{"rendered":"http:\/\/xlogic.org\/blog\/?p=650"},"modified":"2026-08-01T14:25:30","modified_gmt":"2026-08-01T12:25:30","slug":"come-impostare-un-file-robots-txt-per-il-controllo-degli-spiders","status":"publish","type":"post","link":"https:\/\/xlogic.org\/blog\/come-impostare-un-file-robots-txt-per-il-controllo-degli-spiders.html\/","title":{"rendered":"Robots.txt per spider: regole e controlli"},"content":{"rendered":"<p><!-- xlogic-seo-lotto50-2-20260801:650 --><\/p>\n<div class=\"xlogic-direct-answer\">\n<p><strong>Il file robots.txt comunica ai crawler quali percorsi possono o non possono visitare.<\/strong> Non protegge contenuti riservati e non garantisce la rimozione dall\u2019indice: per questo servono autenticazione, noindex o gestione degli URL secondo il caso.<\/p>\n<p><em><strong>Nota di aggiornamento:<\/strong> Una regola errata pu\u00f2 bloccare risorse o sezioni importanti. Prima della pubblicazione verifica sintassi, maiuscole, percorsi e comportamento con gli strumenti del motore di ricerca.<\/em><\/p>\n<\/div>\n<h2>Informazioni aggiornate e controlli essenziali<\/h2>\n<p>Il file\u00a0<strong>robots.txt<\/strong> \u00e8\u00a0un semplice file di testo che contiene delle regole usate dagli Spider (Crawler)\u00a0per applicare restrizioni sulle pagine di un sito web. I Web Crawler sono dei software programmati che effettuano ricerche sul Web e indicizzazioni per i motori di ricerca, quando analizzano un sito web controllano l&#8217;esistenza del file Robots.txt e se vi trovano delle regole o restrizioni le applicano.<\/p>\n<p>Il file robots.txt viene inserito nella directory principale di un sito web ed\u00a0\u00e8 puramente consultivo, non tutti gli Spider applicano le regole inserite in esso.<\/p>\n<p>&nbsp;<\/p>\n<p><strong>Perch\u00e9 \u00e8 un file robots.txt \u00e8 importante?<\/strong><\/p>\n<p>Per evitare lo spreco di risorse del server,\u00a0molti, se non la maggior parte dei siti web, hanno degli script che girano sul loro sito web che\u00a0non hanno nessuna utilit\u00e0 pratica per un motore di ricerca, quando i robot dei motori \u00a0indicizzano il sito \u00e8 possibile tramite il file robots.txt impedire agli spider l&#8217;indicizzazione di tali script, riducendo\u00a0il carico sul server e eliminando le esecuzioni non necessarie.<\/p>\n<p>&nbsp;<\/p>\n<p><strong>Ridurre la larghezza di banda<\/strong><\/p>\n<p>Se guardate le statistiche del vostro sito web, troverete molte richieste per il Robots.txt da parte degli spider dei motori di ricerca.\u00a0I motori di ricerca tentano di recuperare il robots.txt prima di indicizzare il sito web, per vedere se ha istruzioni per loro.<\/p>\n<p>Se non si dispone di un file robots.txt, il server restituisce una pagina di errore 404 per il motore, questo causa l&#8217;utilizzo di molta banda a causa delle sue ripetute richieste per recuperare il file 404.<\/p>\n<p>Qualche motore di ricerca indicizza anche i file grafici tipo .Gif, .Jpg e .Png, se si desidera bloccarli per risparmiare banda, lo si pu\u00f2 fare usando il file robots.txt.<\/p>\n<p>&nbsp;<\/p>\n<p><strong>Come impostare un file robots.txt<\/strong><\/p>\n<p>Scrivere un file robots.txt \u00e8 estremamente semplice. E&#8217; solo un file di testo ASCII che si colloca alla radice del vostro dominio.\u00a0Ad esempio, se il dominio \u00e8 www.esempio.com, bisogner\u00e0 inserire il file in www.esempio.com\/robots.txt.<\/p>\n<p>Per coloro che non sanno cosa sia un file di testo ASCII, \u00e8 solo un file di testo che si crea con un editor di testo. Se utilizzate Windows, \u00e8 gi\u00e0 presente un editor di testo sul vostro sistema, chiamato Blocco note.<\/p>\n<p>Il file Robots.txt elenca fondamentalmente i nomi degli Spider su una linea, seguito da un elenco di directory o file da non indicizzare.<\/p>\n<p>Ogni riga del file contiene un record. Ogni record ha la seguente sintassi\u00a0:<\/p>\n<pre><strong>&lt;campo&gt; : &lt;valore&gt;<\/strong><\/pre>\n<p>I campi disponibili sono\u00a0:<\/p>\n<p><strong>User-Agent<\/strong> il valore di questo campo contiene il nome del robot che si deve attenere alle restrizioni. Con il carattere\u00a0<strong>*<\/strong> la regola viene applicata a qualsiasi robot.<\/p>\n<p><strong>Disallow <\/strong>il valore di questo campo contiene le pagine del sito che devono essere escluse dai robot durante l&#8217;indicizzazione. Si pu\u00f2 indicare un URL specifico o una serie di URL appartenenti ad un pattern. Per ogni\u00a0<em>User-Agent<\/em> \u00e8 possibile specificare una o pi\u00f9 restrizioni tramite\u00a0<em>Disallow<\/em>.<\/p>\n<p>Il file robots.txt \u00e8 case sensitive quindi se blocchiamo la pagina \/PAGINA_DA_BLOCCARE sar\u00e0 differente da bloccare la pagina \/pagina_da_bloccare.<\/p>\n<p>&nbsp;<\/p>\n<p><strong>Esempio (1) file robots.txt<\/strong><\/p>\n<p>Per permettere l&#8217;accesso a tutto il sito web, non indicare nulla nella direttiva Disallow. Alcuni\u00a0crawler supportano anche la direttiva Allow<\/p>\n<pre>User-agent: *\r\nDisallow:<\/pre>\n<p>Per bloccare un intero sito, utilizza una barra.<\/p>\n<pre>User-agent: *\r\nDisallow: \/<\/pre>\n<p>Per bloccare una directory e il relativo contenuto, fai seguire il nome della directory da una barra.<\/p>\n<pre>User-agent: *\r\nDisallow: \/private_directory\/<\/pre>\n<p>Per bloccare una pagina, indica tale pagina.<\/p>\n<pre>User-agent: *\r\nDisallow: \/private_file.html<\/pre>\n<p>Per segnalare il file\u00a0<strong>Sitemap<\/strong> del sito.<\/p>\n<pre>Sitemap: http:\/\/www.esempio.com\/sitemap.xml<\/pre>\n<p>&nbsp;<\/p>\n<p><strong>Esempio (2) file robots.txt<\/strong><\/p>\n<pre>User-agent: *\r\nDisallow: \/cgi-bin\/<\/pre>\n<p>Le due righe sopra, inserite in un file robots.txt, informano tutti i robot che non sono autorizzati ad accedere nella directory e nelle sottodirectory di\u00a0<strong>cgi-bin<\/strong>.<\/p>\n<p>&nbsp;<\/p>\n<p>E&#8217; possibile, bloccare i robot che indicizzano le immagini, tipo Google Image Search, inserendo le righe seguenti:<\/p>\n<pre>User-agent: Googlebot-Image\r\nDisallow: \/<\/pre>\n<p>Ci\u00f2 significa che il robot di Google Image Search, non dovrebbe tentare di accedere a qualsiasi file nella directory radice <strong>\/<\/strong> e in tutte le sue sottodirectory.<\/p>\n<p>&nbsp;<\/p>\n<p>\u00c8 possibile avere pi\u00f9 linee Disallow per ogni user agent (cio\u00e8, per ogni spider). Ecco un esempio di file robots.txt pi\u00f9 lungo:<\/p>\n<pre>User-agent: *\r\nDisallow: \/images\/\r\nDisallow: \/cgi-bin\/\r\nUser-agent: Googlebot-Image\r\nDisallow: \/<\/pre>\n<p>&nbsp;<\/p>\n<p>E&#8217; possibile escludere l&#8217;indicizzazione di un determinato file. Per esempio, se non volete fare indicizzare l&#8217;immagine <strong>test.jpg<\/strong>, dovrete aggiungere le seguenti righe:<\/p>\n<pre>User-agent: Googlebot-Image\r\nDisallow: \/images\/test.jpg<\/pre>\n<p>&nbsp;<\/p>\n<p><strong>Senza restrizioni<\/strong><\/p>\n<p>Se si desidera che tutte le directory vengano indicizzate da tutti i motori di ricerca, basta un semplice file robots con le seguenti righe:<\/p>\n<pre>User-agent: *\r\nDisallow:<\/pre>\n<p>&nbsp;<\/p>\n<p>Alla prossima.<\/p>\n<p>&nbsp;<\/p>\n<p>&nbsp;<\/p>\n<h2>Approfondimenti correlati<\/h2>\n<ul>\n<li><a href=\"https:\/\/xlogic.org\/blog\/come-impostare-correttamente-il-file-robots-txt-e-come-evitare-i-principali-problemi.html\/\">Come configurare il file robots.txt senza errori<\/a><\/li>\n<li><a href=\"https:\/\/xlogic.org\/blog\/ottimizzare-html-seo.html\/\">Come ottimizzare il codice HTML per la SEO<\/a><\/li>\n<\/ul>\n<p><strong>Fonte ufficiale:<\/strong> <a href=\"https:\/\/developers.google.com\/search\/docs\/crawling-indexing\/robots\/intro\" target=\"_blank\" rel=\"noopener noreferrer\">Google Search Central: robots.txt<\/a>.<\/p>\n<h2>Domande frequenti<\/h2>\n<h3>Robots.txt rimuove una pagina da Google?<\/h3>\n<p>Non in modo affidabile. Blocca la scansione, ma un URL pu\u00f2 essere conosciuto tramite collegamenti. Per la deindicizzazione occorrono strumenti appropriati.<\/p>\n<h3>Si possono inserire dati riservati nel robots.txt?<\/h3>\n<p>No. Il file \u00e8 pubblico e non \u00e8 un sistema di sicurezza. Le aree private devono essere protette con autenticazione e permessi.<\/p>\n<h3>Dove si trova il file?<\/h3>\n<p>Normalmente nella radice del protocollo e host, ad esempio https:\/\/example.com\/robots.txt. Le regole valgono soltanto per quello specifico host.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Robots.txt per spider: scopri come usare User-agent, Disallow, Allow e Sitemap, verificare le regole ed evitare blocchi accidentali delle pagine importanti.<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_lmt_disableupdate":"no","_lmt_disable":"","footnotes":""},"categories":[50,1410,1419],"tags":[83,52,87,8,85,132,84,86,82],"class_list":["post-650","post","type-post","status-publish","format-standard","hentry","category-info","category-blogging","category-performance-e-sicurezza","tag-crawler","tag-domini","tag-file-robots","tag-hosting","tag-impostare-robots-txt","tag-redirect-301","tag-robots","tag-robots-txt","tag-spiders"],"modified_by":"Team tecnico Xlogic","_links":{"self":[{"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/posts\/650","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/comments?post=650"}],"version-history":[{"count":0,"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/posts\/650\/revisions"}],"wp:attachment":[{"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/media?parent=650"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/categories?post=650"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/xlogic.org\/blog\/wp-json\/wp\/v2\/tags?post=650"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}