Τι είναι το robots.txt και τι κάνει στην πραγματικότητα
Το robots.txt είναι ένα απλό αρχείο κειμένου που βρίσκεται στη ρίζα του site σου (π.χ. yourdomain.gr/robots.txt) και λέει στους crawlers των μηχανών αναζήτησης ποια σημεία του site επιτρέπεται ή δεν επιτρέπεται να επισκεφτούν. Δεν είναι νόμος· είναι μια οδηγία που σέβονται οι σοβαροί crawlers, όπως ο Googlebot, αλλά κανείς δεν σε υποχρεώνει να τη γράψεις σωστά. Και εδώ ξεκινούν τα προβλήματα, γιατί ένα μικρό λάθος σε αυτό το αρχείο μπορεί να εμποδίσει τη Google να ανιχνεύσει ολόκληρο το site σου, προκαλώντας σοβαρά προβλήματα στην ευρετηρίαση και στην παρουσία του στα αποτελέσματα αναζήτησης, συχνά χωρίς κανένα προειδοποιητικό μήνυμα.
Το πιο συχνό λάθος: Disallow: / που μπλοκάρει τα πάντα
Η γραμμή Disallow: / κάτω από User-agent: * ζητά από όλους τους crawlers που ακολουθούν το robots.txt να μην κάνουν crawl καμία διαδρομή του site. Αυτό συχνά μπαίνει κατά λάθος όταν κάποιος αντιγράφει ρυθμίσεις από ένα staging site που ήθελε να είναι κρυφό, ή όταν ξεχνιέται εκεί μετά τη μετάβαση σε production. Ένα ξεχωριστό αλλά συχνά μπερδεμένο θέμα είναι η επιλογή «Discourage search engines from indexing this site» στις Ρυθμίσεις > Ανάγνωση του WordPress: από την έκδοση 5.3 και μετά, αυτή η επιλογή δεν γράφει Disallow: / στο robots.txt, αλλά προσθέτει οδηγία noindex στις σελίδες, ζητώντας από τις μηχανές αναζήτησης να μην τις εμφανίζουν στα αποτελέσματα. Πολύς κόσμος την αφήνει ενεργή μετά τη μετάβαση από δοκιμαστικό περιβάλλον σε production και αναρωτιέται γιατί το site δεν εμφανίζεται πουθενά.
Άνοιξε το yourdomain.gr/robots.txt στον browser σου μία φορά τον μήνα. Είναι το πιο απλό και πιο συχνά ξεχασμένο τεστ.
Το robots.txt δεν είναι εργαλείο ασφάλειας
Αρκετοί προσπαθούν να «κρύψουν» ευαίσθητους φακέλους βάζοντας, για παράδειγμα, Disallow: /private-folder/ ή Disallow: /backups/, νομίζοντας ότι αυτό εμποδίζει την πρόσβαση. Δεν εμποδίζει τίποτα· απλά ζητά ευγενικά από τους crawlers να μην τα επισκεφτούν. Ο φάκελος παραμένει προσβάσιμος σε οποιονδήποτε ξέρει ή μαντέψει τη διαδρομή, και μερικές φορές το ίδιο το robots.txt λειτουργεί σαν χάρτης για κάποιον που ψάχνει ευάλωτα σημεία, αφού δείχνει ακριβώς ποιους φακέλους θέλεις να κρατήσεις κρυφούς. Αν κάτι πρέπει να είναι πραγματικά προστατευμένο, η λύση είναι έλεγχος πρόσβασης μέσω .htaccess, κωδικός, ή σωστά δικαιώματα αρχείων, όχι μια γραμμή σε αρχείο κειμένου που ο καθένας μπορεί να διαβάσει.
Όταν μπλοκάρεις CSS και JS χωρίς να το καταλάβεις
Μια λιγότερο γνωστή παγίδα είναι το μπλοκάρισμα φακέλων όπως το /wp-content/ ή του theme folder με σκοπό να «καθαρίσεις» το crawling. Το πρόβλημα είναι ότι εκεί βρίσκονται συνήθως τα αρχεία CSS και JavaScript που χρειάζεται ο Googlebot για να αποδώσει τη σελίδα όπως τη βλέπει ένας επισκέπτης. Αν ο crawler δεν μπορεί να φορτώσει αυτά τα αρχεία, βλέπει μια σελίδα χωρίς στυλ και χωρίς λειτουργικότητα, κάτι που επηρεάζει την κατανόηση του περιεχομένου και έμμεσα την κατάταξη. Ο κανόνας είναι απλός: μπλοκάρεις μόνο διαδρομές που δεν έχουν καμία σχέση με την απόδοση ή το περιεχόμενο της σελίδας, όχι ολόκληρους φακέλους assets.
Λάθος διαδρομή στο sitemap μέσα στο robots.txt
Πολλά plugins SEO προσθέτουν αυτόματα μια γραμμή Sitemap: στο τέλος του robots.txt που δείχνει προς το sitemap.xml. Αν το site έχει μεταφερθεί σε νέο domain, έχει αλλάξει διεύθυνση από http σε https, ή χρησιμοποιεί άλλο plugin SEO από πριν, αυτή η γραμμή μπορεί να δείχνει σε διαδρομή που δεν υπάρχει πια. Δεν ρίχνει το site, αλλά μπερδεύει τους crawlers και μπορεί να καθυστερήσει την ανακάλυψη νέου περιεχομένου. Αξίζει να την ελέγχεις μετά από κάθε αλλαγή domain ή SEO plugin.
Ξέχασες να το αλλάξεις μετά τη μεταφορά από staging
Αυτό είναι από τα πιο συνηθισμένα σεναρίου: το staging site έχει σκόπιμα Disallow: / για να εμποδίσει τη Google να το κάνει crawl πριν είναι έτοιμο, και όταν το site μεταφέρεται σε production αυτή η ρύθμιση έρχεται μαζί χωρίς να το προσέξει κανείς. Αν βρίσκεσαι σε φάση μεταφοράς site, αξίζει να δεις τη λίστα ελέγχου πριν μεταφέρεις το site σου, όπου το robots.txt είναι ένα από τα σημεία που πρέπει να ελέγχονται πριν και μετά τη μετάβαση.
Πώς ελέγχεις το robots.txt σου σωστά
- Άνοιξε το yourdomain.gr/robots.txt απευθείας στον browser και διάβασέ το γραμμή προς γραμμή.
- Χρησιμοποίησε το robots.txt report μέσα στο Google Search Console για να δεις αν η Google μπορεί να διαβάσει σωστά το αρχείο, και το URL Inspection για να ελέγξεις αν συγκεκριμένη σελίδα επιτρέπεται να γίνει crawl.
- Αν χρειάζεσαι επεξεργασία του αρχείου χειροκίνητα, μπορείς να το κάνεις μέσα από το File Manager στο cPanel, χωρίς να χρειάζεται FTP client.
- Θυμήσου ότι αν μια σελίδα είναι ήδη ευρετηριασμένη, το robots.txt δεν την αφαιρεί από τα αποτελέσματα· για μόνιμη αφαίρεση χρησιμοποίησε
noindexή επέστρεψε κατάλληλο HTTP status όπως 404/410 αν η σελίδα έχει καταργηθεί. Το εργαλείο Removals του Search Console μπορεί να χρησιμοποιηθεί όταν χρειάζεται γρήγορη, προσωρινή απόκρυψη. - Αν χρησιμοποιείς
noindexσε μια σελίδα, βεβαιώσου ότι το ίδιο το robots.txt επιτρέπει το crawling της· αν η σελίδα είναι μπλοκαρισμένη από crawling, η Google δεν μπορεί καν να δει την οδηγία noindex.
Το συμπέρασμα
Το robots.txt είναι ένα μικρό αρχείο με μεγάλη επίδραση. Δεν χρειάζεται πολύπλοκες ρυθμίσεις· χρειάζεται προσοχή στις λεπτομέρειες και έλεγχο μετά από κάθε αλλαγή, migration ή ενεργοποίηση νέου plugin SEO. Ένα λάθος τσεκάρισμα ή μια ξεχασμένη γραμμή μπορεί να κρατήσει το site σου αόρατο για μήνες πριν το προσέξει κάποιος.


