Internet Archive i Wayback Machine w SEO
Internet Archive to internetowa biblioteka, która od 1996 roku archiwizuje publicznie dostępne strony, a Wayback Machine (web.archive.org) to jej usługa do przeglądania zapisanych wersji tych stron. W SEO archiwum służy do trzech rzeczy: odtworzenia listy starych adresów URL do mapy przekierowań, sprawdzenia, co było na stronie przed zmianą, i poznania historii domeny przed jej zakupem. Nie jest kompletne i nie zastąpi danych z własnego serwera, ale bywa jedynym śladem po serwisie, którego już nie ma.
Czym jest Internet Archive i Wayback Machine
Internet Archive powstało, żeby zachować cyfrowe ślady kultury i stworzyć internetową bibliotekę dla badaczy, historyków i naukowców. Według informacji o Wayback Machine w centrum pomocy archiwum organizacja zaczęła archiwizować sieć w 1996 roku. Nazwa usługi nawiązuje do maszyny WABAC, czytanej „way-back”, z serialu animowanego „Rocky and Bullwinkle”.
Korzystanie z Wayback Machine jest proste: wpisuje się adres strony, wybiera datę z kalendarza i ogląda kopię zapisaną tego dnia. Kropki w kalendarzu oznaczają zapisane kopie, a po najechaniu na którąś z nich widać, z jakiego przebiegu robota pochodzi. Archiwum zbiera strony wieloma przebiegami robotów i samo zaznacza, że za każdym z nich stoi osobna historia: kto, dlaczego, kiedy i jak go przeprowadził. Kto szuka „webarchive” albo „archive.org web”, zwykle ma na myśli właśnie tę usługę.
Każda kopia ma adres złożony z web.archive.org/web/, czternastocyfrowego znacznika czasu w formacie rok, miesiąc, dzień, godzina, minuta, sekunda oraz oryginalnego adresu, na przykład https://web.archive.org/web/20130919044612/http://example.com/. Taki adres można wkleić do raportu z audytu jako dowód, jak strona wyglądała danego dnia.
Stare adresy URL do mapy przekierowań
Przy zmianie adresów URL, czyli przy nowej domenie, nowej strukturze adresów albo przejściu na inny system, Google w dokumentacji przenoszenia witryny ze zmianą adresów URL zaleca przygotowanie mapy: każdemu staremu adresowi przypisuje się nowy odpowiednik, a potem serwer przekierowuje jeden na drugi. Przy samej zmianie domeny może wystarczyć reguła z symbolem wieloznacznym, ale przy bardziej złożonej przeprowadzce potrzebna jest lista starych adresów. Google podpowiada, skąd ją wziąć: z map witryny, z logów serwera, z narzędzi analitycznych, z raportu linków w Search Console i z systemu zarządzania treścią.
Wszystkie te źródła zakładają, że stary serwis albo jego dane wciąż istnieją. W audytach po przebudowie regularnie trafiamy na sytuację, w której ich już nie ma: hosting wygasł, poprzedni wykonawca nie przekazał eksportu ani logów, a nowa strona działa od miesięcy. Wtedy lista z Wayback Machine bywa jedynym punktem wyjścia do mapy przekierowań. Traktujemy ją jako uzupełnienie, a nie pełną inwentaryzację, bo archiwum zapisuje tylko to, do czego dotarły jego roboty, i łączymy ją z każdym innym źródłem, które jeszcze da się odzyskać.
Sama przeprowadzka strony ma więcej etapów niż mapa adresów, od weryfikacji starej i nowej wersji w Search Console po obserwowanie ruchu na obu. W tym tekście zostajemy przy tym, w czym pomaga archiwum.
Availability API i CDX API: adresy z archiwum
Archiwum udostępnia dwa interfejsy przydatne przy takiej pracy. Pierwszy, Wayback Availability JSON API, odpowiada na pytanie, czy konkretny adres ma zapisaną kopię. Zapytanie https://archive.org/wayback/available?url=example.com zwraca najbliższą kopię z jej adresem, znacznikiem czasu i kodem odpowiedzi. Parametr timestamp wskazuje datę, wokół której szukać, a gdy kopii nie ma, odpowiedź zawiera pusty obiekt archived_snapshots. Archiwum samo podaje, że to API przydaje się w obsłudze błędu 404: strona, która nie znalazła treści, może sprawdzić, czy istnieje jej kopia.
Drugi interfejs, CDX Server API, daje dostęp do indeksu, z którego korzysta sam Wayback Machine. Każdy wiersz to jedna zapisana kopia z polami urlkey, timestamp, original, mimetype, statuscode, digest i length. Do zbudowania listy starych adresów domeny wystarczy jedno zapytanie:
https://web.archive.org/cdx/search/cdx?url=example.com/*&output=json&fl=original,timestamp,statuscode,mimetype&filter=statuscode:200&filter=mimetype:text/html&collapse=urlkey
Gwiazdka na końcu adresu oznacza wszystkie adresy pod tą ścieżką, fl wybiera kolumny, oba filtry zostawiają tylko kopie stron HTML zapisane z kodem 200, a collapse=urlkey zostawia po jednym wierszu na każdy adres. Dokumentacja opisuje też matchType=domain, które obejmuje subdomeny, i zawężanie dat parametrami from oraz to. Przy dużych serwisach przydają się limity wyników, paginacja i klucz wznowienia, a zapytanie z collapse=urlkey po prefiksie dokumentacja sama określa jako potencjalnie wolne.
Kod w kolumnie statuscode to odpowiedź, którą robot archiwum dostał w dniu zapisu, a nie stan dzisiejszy. Ta sama lista pomaga też znaleźć strony osierocone: stare adresy, które wciąż odpowiadają kodem 200, ale nie prowadzi do nich żaden link na obecnej stronie.
Co zrobić z listą starych adresów
Sama lista niczego nie naprawia. Każdy adres trzeba dziś odpytać i porównać wynik z tym, co dokumentacja Google o przeprowadzce mówi o przekierowaniach:
- Treść przeniesiona pod nowy adres dostaje stałe przekierowanie po stronie serwera. Google zaleca przekierowania trwałe, takie jak 301 i 308, prowadzące od razu do adresu docelowego. Gdy łańcucha nie da się uniknąć, dokumentacja radzi trzymać go krótko: najlepiej nie więcej niż trzy przekierowania, a w każdym razie mniej niż pięć.
- Wiele starych adresów skierowanych na jedną niezwiązaną stronę, na przykład na stronę główną, to według Google błąd, który może zmylić użytkowników i zostać potraktowany jak soft 404. Wyjątkiem jest treść z kilku stron połączona w jedną: wtedy stare adresy wolno skierować na tę nową, wspólną stronę.
- Treść, której nie przeniesiono na nową stronę, ma według dokumentacji poprawnie zwracać tam kod 404 albo 410. To nie jest błąd do naprawienia, tylko informacja dla robota, że strony już nie ma.
Google zaleca utrzymywać przekierowania tak długo, jak to możliwe, zwykle co najmniej rok, bo taki okres pozwala Google przenieść wszystkie sygnały na nowe adresy, w tym ponownie zeskanować i przypisać im linki z innych stron. Z perspektywy użytkowników dokumentacja radzi rozważyć utrzymanie przekierowań bezterminowo.
Historia treści: co było na stronie przed zmianą
Drugą rzeczą, której nie da się odtworzyć z obecnej strony, jest jej dawna treść: dokładne brzmienie tekstu, kolejność sekcji i linki, które z niej prowadziły.
Gdy po przebudowie strona traci widoczność na zapytania, na które wcześniej odpowiadała, porównujemy w audycie zarchiwizowaną wersję podstrony z obecną. Najczęściej okazuje się, że zniknął fragment tekstu odpowiadający wprost na pytanie, zmienił się tytuł albo nagłówek, albo strona straciła linki wewnętrzne z menu i z powiązanych artykułów. Kopia z archiwum zamienia spór o to, „co było wcześniej”, w porównanie dwóch konkretnych wersji.
Przy takim porównaniu warto pamiętać o dwóch ograniczeniach. Archiwum dobrze zachowuje strony, które wyświetlają zwykły HTML, ale formularze, JavaScript i elementy wymagające połączenia z pierwotnym serwerem tracą w kopii swoją funkcję, więc ocenia się tekst i strukturę, a nie działanie strony. Poza tym data kopii mówi, kiedy robot archiwum ją zapisał, a nie kiedy strona się zmieniła: zmiana nastąpiła gdzieś między dwiema kolejnymi kopiami.
Domena przed zakupem
Google w polityce spamu opisuje nadużycie wygasłych domen: wygasłą domenę kupuje się i wykorzystuje przede wszystkim do manipulowania pozycjami w wynikach, publikując treści o niewielkiej albo żadnej wartości dla użytkowników. Jako przykłady polityka podaje treści afiliacyjne na stronie, z której wcześniej korzystała agencja rządowa, sprzedaż komercyjnych produktów medycznych na stronie, z której korzystała medyczna organizacja charytatywna non-profit, i treści kasynowe na stronie dawnej szkoły podstawowej. Polityka opisuje więc nadużycie, a nie sam zakup.
Wayback Machine pozwala zobaczyć, co było pod adresem, zanim się go kupi. Przed zakupem domeny albo przy przejęciu cudzej strony przeglądamy kopie z różnych lat. Szukamy przerw, po których domena wraca z zupełnie inną tematyką, stron w języku niezwiązanym z rynkiem, treści z branż przywołanych w przykładach polityki spamu i okresów, w których pod adresem stała tylko oferta sprzedaży domeny.
Brak kopii nie dowodzi, że domena była pusta: według archiwum strony mogą do niego nie trafić z powodu wykluczeń w robots.txt, a niektóre witryny są wyłączone na prośbę właściciela. Po zakupie ta sama dokumentacja Google o przeprowadzce zaleca sprawdzić w Search Console, czy na domenie nie ciąży ręczne działanie za wcześniejszy spam i czy poprzedni właściciel nie zostawił zgłoszeń usunięcia adresów, zwłaszcza obejmujących całą witrynę.
Ograniczenia i usuwanie z archiwum
Wayback Machine nie jest kopią całej sieci. Według centrum pomocy archiwum zbiera strony publicznie dostępne: nie zapisuje stron chronionych hasłem ani takich, do których dochodzi się dopiero po wysłaniu formularza. Strony mogą też nie trafić do archiwum z powodu wykluczeń w robots.txt, a niektóre witryny są wyłączone na bezpośrednią prośbę właściciela. Archiwum zaznacza również, że publicznie dostępne strony, które zbiera, mogą zawierać dane osobowe.
Właściciel strony może poprosić o wykluczenie jej kopii z web.archive.org. Według instrukcji archiwum dotyczącej usuwania treści wniosek wysyła się na adres info@archive.org i podaje w nim adres lub adresy URL, okres, który ma zostać wykluczony, okres, w którym kontrolowało się stronę lub konto, oraz inne informacje pomocne w ocenie. Wniosek uruchamia przegląd przez zespół archiwum, który nie gwarantuje z góry jego wyniku. Roszczenia dotyczące praw autorskich obsługuje osobna procedura z polityki praw autorskich archiwum, w której archiwum zastrzega, że może według własnego uznania usunąć treść albo zablokować do niej dostęp.
Opisujemy tę procedurę tak, jak przedstawia ją samo archiwum; nie jest to porada prawna. Warto tylko pamiętać, że wykluczonych kopii nie zobaczy później nikt, kto będzie odtwarzał historię strony, także jej właściciel przy następnej przeprowadzce.
Wayback Machine a Google
11 września 2024 roku Internet Archive ogłosiło nową funkcję w wyszukiwarce Google: po kliknięciu trzech kropek przy wyniku otwiera się panel „About this Result”, a w nim, po wybraniu „More About This Page”, pojawia się link do strony w Wayback Machine. Według ogłoszenia link nie jest dostępny, gdy właściciel praw zrezygnował z archiwizacji swojej witryny albo gdy strona narusza zasady dotyczące treści. Opisujemy funkcję według ogłoszenia z tamtego dnia; wygląd panelu w wynikach mógł się od tego czasu zmienić.
W tym samym czasie Google porządkował dokumentację po wycofaniu własnych kopii stron. W dzienniku zmian dokumentacji Google Search Central 24 września 2024 roku Google usunął opis operatora cache:, bo przestał on działać w wyszukiwarce, a 2 października 2024 roku przeniósł regułę noarchive do sekcji historycznej, bo link do kopii w pamięci podręcznej nie jest już dostępny w wynikach. Google dodał przy tym, że tagu nie trzeba usuwać, bo mogą z niego korzystać inne wyszukiwarki i usługi.
Kopia w Wayback Machine nie zastępuje jednak wglądu w to, co widzi Google. Pokazuje to, co zapisał robot archiwum, a nie to, co pobrał Googlebot. Ten sam dziennik zmian odnotowuje, że do diagnozowania strony Google odradza kopie z pamięci podręcznej i wskazuje narzędzie do sprawdzania adresów URL w Search Console, bo ma ono najbardziej aktualną wersję strony.
Czego szukamy w Wayback Machine w audycie
Archiwum otwieramy w audycie z konkretnym pytaniem, a nie po to, żeby obejrzeć starą stronę. Najczęściej są to cztery pytania.
Czy stare adresy prowadzą tam, gdzie powinny. Po pobraniu listy z CDX sprawdzamy każdy adres na żywej stronie: czy przekierowuje jednym krokiem na odpowiednik, czy zwraca 404 albo 410 tam, gdzie treść zniknęła świadomie, i czy nie trafia hurtem na stronę główną. Najpierw sprawdzamy adresy, do których prowadzą linki z innych stron, widoczne w raporcie linków w Search Console, bo przy nich zgubione przekierowanie kosztuje najwięcej.
Co zniknęło z przebudowanej podstrony. Porównujemy kopię sprzed zmiany z obecną wersją: tekst, tytuł, nagłówki i linki wewnętrzne, zanim zaczniemy szukać przyczyny spadku gdziekolwiek indziej.
Jaką historię ma domena. Przed zakupem albo przejęciem przeglądamy kopie z kolejnych lat pod kątem zmian tematyki, języka i okresów, w których domena była wystawiona na sprzedaż.
Czy wniosek z archiwum potwierdzają inne dane. Kopia pokazuje, co robot archiwum zapisał danego dnia; nie mówi, co widział Googlebot ani czy strona była w indeksie. Dlatego wnioski z archiwum zawsze zestawiamy z danymi z Search Console i z serwera.
Podsumowanie
Internet Archive przechowuje zapisane wersje publicznych stron od 1996 roku, a Wayback Machine pozwala je przeglądać. W SEO jego wartość jest wąska, ale konkretna: Availability API i CDX API odtwarzają listę starych adresów do mapy przekierowań, kopie podstron pokazują, co było na nich przed zmianą, a historia domeny podpowiada, czy przed zakupem jest się czego obawiać w świetle polityki Google o nadużyciu wygasłych domen.
Archiwum nie jest kompletne i nie pokazuje tego, co widzi Google, więc jego wnioski zawsze trzeba zestawić z danymi z Search Console i z serwera. Przekierowania mają według Google być trwałe, prowadzić prosto do odpowiednika i zostać na miejscu zwykle co najmniej rok.
Jeśli planujesz przebudowę albo przeprowadzkę strony i chcesz, żeby stare adresy nie przepadły, zamów bezpłatną wycenę audytu. Mapę przekierowań i kontrolę po wdrożeniu prowadzimy w ramach usług SEO.