getPage
Dokumentacja / podręcznik użytkownika

Instrukcja obsługi programu getPage

Praktyczny przewodnik po pracy z getPage: pierwsze uruchomienie, ustawienia crawlera, lokalne kopie offline, katalogi wyjściowe i biblioteka pobranych stron.

Aktualizacja: 12 maja 2026Dotyczy getPage 2.xLite i Pro

1. Szybki start

  1. Uruchom getPage i przejdź do zakładki Start.
  2. Wpisz adres strony w polu URL startowy, na przykład https://example.com/.
  3. Sprawdź szybkie parametry: głębokość, limit stron, opóźnienie, timeout, JavaScript i katalog wyjściowy.
  4. Kliknij duży zielony przycisk Rozpocznij.
  5. Obserwuj postęp w zakładce Pobieranie, a potem otwórz wynik z Wyniki albo Pobrane strony.
Najwygodniejszy wariant pracy: wybierz jeden katalog bazowy, zaznacz Utwórz podkatalogi i pozwól programowi tworzyć czysty folder dla każdego pobrania.

2. Interfejs programu

[Start]

Start

Główne miejsce pracy. Zawiera pole URL, przyciski Start/Stop i szybkie bloki parametrów. Kliknięcie bloku liczbowego otwiera edycję, a kliknięcie katalogu pozwala wybrać folder zapisu.

[Log]

Pobieranie

Pokazuje pasek postępu, licznik pobranych stron, kolejkę i kolorowy log z informacjami o stronach, zasobach, limitach, robots.txt i błędach.

[HTML]

Wyniki

Wyświetla pobrane strony z tytułami i metadanymi. Możesz podejrzeć treść, otworzyć adres źródłowy albo wskazać lokalny plik index.html.

[Library]

Pobrane strony

Biblioteka lokalnych kopii stron. Każdy kafelek otwiera zapisany index.html i ma menu do zmiany nazwy, usunięcia skrótu albo usunięcia plików.

3. Ustawienia pobierania

Większość ustawień jest dostępna w menu Konfiguracja. Najczęściej używane opcje są też pokazane jako bloki na zakładce Start.

UstawienieZnaczenieWskazówka
Maksymalna głębokośćOkreśla, jak daleko od strony startowej program podąża za linkami. W Pro wartość 0 oznacza brak limitu głębokości.Na początek ustaw 1-2, aby poznać strukturę witryny.
Maksymalna liczba stronŁączna liczba stron możliwych do pobrania w jednym przebiegu.Przy dużych serwisach użyj najpierw limitu testowego.
OpóźnienieCzas oczekiwania między żądaniami HTTP.Większe opóźnienie zmniejsza obciążenie serwera.
TimeoutMaksymalny czas oczekiwania na odpowiedź serwera.Zwiększ go dla wolniejszych stron.
Renderowanie JavaScriptUżywa Chromium przez Playwright, aby zapisać treść ładowaną dynamicznie.Włącz dla stron React, Vue, Angular i podobnych.
Konwertuj linki na lokalnePrzepisuje linki wewnętrzne tak, aby kopia działała offline.Włącz, gdy chcesz lokalny mirror.
Eksport JSONZapisuje treść i metadane do pages.json.Przydatne do audytu, migracji i analizy.
Pobieraj zasobyPobiera obrazy, CSS, JavaScript, czcionki, audio, wideo i ikony strony.Zostaw włączone, chyba że potrzebujesz tylko HTML/tekstu.

Selektory treści głównej

Panel Selektory treści głównej pozwala ustawić selektory CSS używane do czystego eksportu treści do JSON, np. main, article, .content albo #main.

4. Katalog wyjściowy i pliki

Jeżeli nie wybierzesz katalogu ręcznie, getPage używa folderu ~/getPage. Możesz go zmienić w Konfiguracja -> Katalog wyjściowy... albo klikając blok katalogu na zakładce Start.

Z konwersją linków

HTML i zasoby są zapisywane tak, aby kopia była wygodna do przeglądania offline.

~/getPage/
  index.html
  pages.json
  assets/
  style_abc123.css
  app_def456.js

Bez konwersji linków

HTML trafia zwykle do pages/, a zasoby statyczne do assets/.

~/getPage/
  pages/
    index.html
    kontakt.html
  assets/
    logo.png
    style.css
  pages.json

pages.json zawiera adresy źródłowe, tytuły, opisy, kanoniczne URL-e, wyodrębnioną treść i lokalne ścieżki do zapisanych plików.

5. Automatyczne podkatalogi

Opcja Utwórz podkatalogi znajduje się w bloku Katalog wyjściowy na zakładce Start. Po jej zaznaczeniu wybrany katalog staje się katalogiem bazowym, a każde pobieranie dostaje nowy pusty podkatalog.

~/getPage/
  example.com_2026-05-11_001/
  example.com_2026-05-11_002/
  nci.pl_2026-05-11_001/
To rozdziela pobrania, chroni przed przypadkowym nadpisaniem wyników i usuwa konieczność ręcznego wybierania folderu przy każdym przebiegu.

Gdy opcja jest wyłączona, getPage zapisuje bezpośrednio do wskazanego folderu. Jeśli folder nie jest pusty, program ostrzega i pozwala przerwać, wyczyścić folder albo utworzyć folder obok.

6. Tryb offline i wyniki

Najlepsze efekty offline daje połączenie opcji Konwertuj linki na lokalne, Pobieraj zasoby i, dla stron dynamicznych, Renderowanie JavaScript.

  • Zakładka Wyniki pokazuje pobrane strony i tytuły.
  • Podgląd offline uruchamia lokalny serwer na 127.0.0.1, aby przeglądarka poprawnie ładowała zasoby.
  • Jeżeli masz już istniejący mirror, możesz wskazać jego index.html. Na Windows to celowo wybór pliku, bo systemowy wybór katalogu często ukrywa pliki.

7. Pobrane strony

Po udanym pobraniu getPage tworzy skrót w zakładce Pobrane strony. Kafelki działają podobnie do ikon na pulpicie: główna ikona otwiera lokalną stronę, a przycisk menu zawiera akcje zarządzania.

AkcjaCo robi
OtwórzOtwiera lokalny plik index.html danej kopii.
Zmień nazwęZmienia tylko podpis w bibliotece, bez zmiany nazwy katalogu na dysku.
Usuń skrótUsuwa wpis z biblioteki. Pliki zostają na dysku.
Usuń skrót i pobraną stronęUsuwa wpis oraz cały folder pobranej strony po potwierdzeniu.

8. Lite, Pro i licencja

FunkcjaLitePro
Maksymalna głębokośćDo 2 poziomówBez limitu
Maksymalna liczba stronDo 50 stronBez limitu
Minimalne opóźnienie2 sekundyMożna ustawić krótsze
User-AgentStały domyślnyMożna zmienić
Tryb offline, JavaScript, JSON, zasobyDostępneDostępne

Domyślnym zakupem Pro jest dodatek w Microsoft Store. To jednorazowy zakup przypisany do konta Microsoft, bez limitu liczby aktywacji. Alternatywnie menu Licencja -> Przejdź na Pro przyjmuje też kod aktywacyjny z nci.pl; takie kody można aktywować do 20 razy i należy je dezaktywować przed przeniesieniem na inne urządzenie. Dane licencji pozostają bez zmian po aktualizacji getPage do nowszej wersji.

9. Dobre praktyki i bezpieczeństwo

  • Pobieraj tylko strony, do których masz prawo dostępu i archiwizacji.
  • Respektuj robots.txt, regulaminy witryn, prawo autorskie i przepisy o ochronie danych.
  • Nie ustawiaj zbyt agresywnego opóźnienia. Duże serwisy mogą blokować intensywne pobieranie.
  • Zaczynaj od małej głębokości i niskiego limitu stron, aby poznać strukturę linków.
  • Dla ważnych projektów używaj automatycznych podkatalogów albo osobnych folderów.
getPage jest narzędziem do legalnej archiwizacji i analizy. Użytkownik odpowiada za sposób wykorzystania pobranych treści.

10. Rozwiązywanie problemów

W pobranej kopii brakuje treści

Włącz Renderowanie JavaScript i zwiększ Czas oczekiwania na JS. Część stron ładuje ważne elementy dopiero po kilku sekundach.

Brakuje obrazków, CSS, skryptów albo ikon

Upewnij się, że włączona jest opcja Pobieraj zasoby. Zasoby z zewnętrznych domen mogą być pomijane zależnie od struktury strony i zasad bezpieczeństwa.

Katalog wyjściowy nie jest pusty

To zabezpieczenie istniejących plików. Możesz przerwać, wyczyścić katalog po potwierdzeniu, utworzyć folder obok albo włączyć Utwórz podkatalogi.

Strona działa lepiej w podglądzie niż z dysku

Niektóre skrypty nie działają dobrze z file://. Użyj lokalnego serwera podglądu z zakładki Wyniki.