Mój robots.txt pokazuje całą stronę HTML. Google to zrozumie?

Od kilku dni mam w sklepie włączony CDN, głównie przez ciężkie zdjęcia produktów. Dzisiaj z ciekawości weszłam na /robots.txt i zamiast kilku linijek z User-agent i Sitemap wyświetliła mi się praktycznie cała strona sklepu. Jest nagłówek, menu, stopka, tylko w środku prawie nic. Zajrzałam do źródła i tam też jest normalny HTML motywu. Reszta sklepu działa, żadnej awarii nie widzę. Wyczyściłam cache w panelu, ale pod tym adresem nadal ładuje się to samo. Nie mam pojęcia, czy robots.txt był u mnie prawdziwym plikiem, czy sklep tworzył go sam. Google jakoś rozpozna, że chodzi o reguły dla robota, czy zobaczy po prostu kolejną stronę HTML? Trochę boję się wkleić gotowy plik znaleziony w sieci i narobić większego bałaganu. Od czego byście zaczęli i czy po naprawie trzeba go gdzieś ponownie zgłosić?

Dyskusja

15 odpowiedzi
MartaK
Raczej bym na to nie liczyła. Jeśli pod robots.txt ładuje się cały sklep, to coś ewidentnie podaje nie tę treść.
KrzysiekM
A sprawdzałaś, jaki kod odpowiedzi zwraca ten adres i co jest przy Content-Type? Podejrzałbym też sam początek odpowiedzi, nie tylko widok w przeglądarce. Jak wyjdzie text/html i kod motywu, to przynajmniej będzie wiadomo, że to nie przeglądarka coś dziwnie pokazuje.
IzaSklepik

W odpowiedzi do: KrzysiekM

Sprawdziłam. Jest 200, ale przy typie treści mam text/html, a odpowiedź zaczyna się od doctype i kodu motywu. Żadnych reguł tam nie widzę. Przed uruchomieniem CDN na pewno był w tym miejscu krótki tekst, bo zaglądałam do niego przy mapie strony.
RadekP

W odpowiedzi do: IzaSklepik

No to masz odpowiedź: 200 jest, ale dokument nie ten. Patrzyłbym, co po drodze podmienia albo trzyma starą odpowiedź przed serwerem sklepu.
RadekP
Tylko nie sugeruj się samym 200. Strona błędu albo zwykły szablon też mogą wrócić z takim kodem.
OlaOdSklepu
U mnie po zmianach w cache pod robots.txt zapisała się kiedyś strona z przerwą techniczną. Czyściłam pamięć w panelu sklepu i nic, bo druga kopia siedziała jeszcze przed sklepem. Dopiero gdy poprawiliśmy regułę dla tego adresu i wyczyściliśmy tamten cache, wrócił zwykły tekst. Nie musi być u Ciebie dokładnie to samo, ale moment pojawienia się problemu trochę na to wskazuje.
MichalNaWitrynie
Możliwe też, że w ogóle nie masz fizycznego pliku. W wielu sklepach robots.txt tworzy sam system i czasem żądanie wpada potem w zwykły szablon strony. Gdyby bez CDN dalej wychodził HTML, wtedy zerknąłbym w routing albo we wtyczki. Na razie nie dorabiałbym ręcznie nowego pliku, bo łatwo tylko zakryć właściwą przyczynę.
WojtekZZaplecza
Ja bym na chwilę odłożył temat samej zawartości pliku i sprawdził, gdzie dokładnie robi się podmiana. Masz możliwość wejścia na serwer sklepu z pominięciem CDN, ale nadal z właściwą nazwą hosta? Otwórz wtedy tę samą ścieżkę i zobacz, co wraca. Jeśli na serwerze będzie krótki tekst, a publicznie cały HTML, to CMS raczej jest niewinny i zostaje cache albo reguła na CDN. Gdy HTML pojawi się w obu miejscach, wróciłbym do tropu z systemem sklepu. Takie porównanie da więcej niż wyłączanie po kolei wszystkiego w panelu. Pilnuj tylko, żeby porównywać ten sam host i protokół, bo inaczej wynik może namieszać.
IzaSklepik

W odpowiedzi do: WojtekZZaplecza

Udało mi się wejść bezpośrednio na serwer z zachowaniem nazwy sklepu. Tam robots.txt jest krótkim tekstem i ma te reguły, które pamiętam, a pod publicznym adresem wciąż leci HTML. Czyli CMS mogę raczej odpuścić i szukać już w ustawieniach CDN?
PawelZAgencji

W odpowiedzi do: IzaSklepik

Tak, teraz już bym nie grzebał w CMS-ie. Popraw regułę albo cache po stronie CDN i sprawdź publiczny adres jeszcze raz w świeżej sesji.
JarekNaSpokojnie
I dobrze, że nie wkleiłaś pierwszego gotowca z sieci. Jedno niefortunne Disallow i zamiast naprawy dołożysz sobie prawdziwą blokadę.
PawelZAgencji
Do tego sprawdzenia nie potrzebujesz całego audytu. Ważne, żeby podejrzeć nagłówki i kawałek surowej odpowiedzi, a nie tylko gotową stronę w oknie. Zrób też próbę bez zapisanej kopii, bo przeglądarka potrafi dorzucić własny cache i człowiek później goni nie ten problem. Jeśli publiczny adres za każdym razem daje text/html i motyw, to robot dostaje właśnie to, niezależnie od reguł widocznych w panelu. Potem porównaj wynik z originem, tak jak pisał Wojtek. To powinno wystarczyć, żeby wskazać stronę usterki. Na tym etapie nie ruszałbym produktów ani innych ustawień SEO.
AnetaK
Tylko rozdzielmy jeszcze jedną rzecz, bo przy robots.txt często się to miesza. Ten plik mówi robotowi, gdzie może wejść, ale nie działa jak przycisk do usuwania stron z Google. Błąd oczywiście popraw, natomiast z samego HTML-a pod tym adresem nie wynika, że produkty już wypadły z indeksu. Nie robiłabym więc nerwowo zmian na wszystkich kartach produktów.
EwaN
Po naprawie sprawdź po prostu, czy publicznie wraca już tekst zamiast motywu sklepu. Nie zgłaszałabym przez to każdego produktu osobno, bo to niczego nie przyspieszy. Google pobierze robots.txt ponownie, tylko nikt uczciwie nie poda Ci dokładnej godziny. Najważniejsze, żeby przy następnym pobraniu odpowiedź była już poprawna.
marek77
Sprawdź jeszcze z telefonu poza Wi-Fi albo z czystej sesji. U mnie po zmianie administrator widział już nowy plik, a reszta nadal dostawała starą kopię.