Zyte, własny scraper czy usługa zarządzana — co wybrać

Zyte (dawniej Scrapinghub, twórcy frameworka Scrapy) to platforma API i proxy: klient płaci za żądania i sam utrzymuje logikę ekstrakcji. Własny scraper daje pełną kontrolę kosztem stałego utrzymania. Usługa zarządzana, jak DataMiners, dostarcza gotowy JSON, CSV, XLSX lub API bez własnego zespołu. Decyduje to, czy zespół inżynierski istnieje i skąd pochodzą źródła. Stan na wrzesień 2026.

Imperva w raporcie Bad Bot Report 2024 podała, że 32% globalnego ruchu w internecie generują złośliwe boty — udział rosnący czwarty rok z rzędu. Konsekwencja dotyczy każdego zespołu pobierającego dane publiczne: warstwy antybotowe (Cloudflare, Akamai, DataDome) nie rozróżniają monitoringu cen od ataku. W efekcie środek ciężkości kosztu przesunął się z parsowania HTML na utrzymanie dostępu do źródła. Rachunek build-vs-buy wygląda dziś inaczej niż w 2018 roku.

Na rynku funkcjonują trzy modele. Zyte, założone w 2010 roku jako Scrapinghub i przemianowane w 2020, dostarcza Zyte API, proxy oraz Scrapy Cloud i utrzymuje Scrapy — framework na licencji BSD z ponad 50 tys. gwiazdek na GitHubie. Drugi model to scraper budowany wewnętrznie, zwykle w Pythonie, gdzie organizacja przejmuje pełną odpowiedzialność za retry, rotację adresów i zmiany w strukturze stron. Trzeci to usługa zarządzana, w której dostawca oddaje dane, nie narzędzie. Rozróżnienie jest istotne, bo sam Zyte prowadzi również ofertę zarządzaną (Zyte Data) — porównanie nie jest więc opozycją platformy i usługi, lecz opozycją dwóch poziomów odpowiedzialności.

Po czym realnie wybierać

Kto utrzymuje pipeline po wdrożeniu

W modelu API klient dostaje warstwę dostępu, ale parsery, harmonogram i obsługę zmian w HTML utrzymuje sam. Strony e-commerce zmieniają strukturę front-endu nieregularnie, a każda zmiana selektora oznacza przerwę w danych. Kryterium sprowadza się do jednego pytania: czy w organizacji istnieje osoba odpowiedzialna za ten dyżur.

Charakter i lokalizacja źródeł

Platformy globalne optymalizują pod najczęściej odpytywane domeny — marketplace'y amerykańskie i zachodnioeuropejskie oraz gotowe ekstraktory produktów, artykułów i ofert pracy. Rejestry i portale lokalne (KRS, CEIDG, Allegro, OLX, branżowe katalogi B2B) wymagają dedykowanej logiki, formularzy sesyjnych, a niekiedy parsowania PDF. Rynek dokumentuje tu największą rozbieżność między ofertą generyczną a dedykowaną.

Format odbioru danych

API zwraca odpowiedź do dalszego przetworzenia; dział analityczny oczekuje pliku. Różnica przekłada się na dodatkową warstwę ETL po stronie klienta — normalizacja, deduplikacja, mapowanie identyfikatorów. DataMiners oddaje JSON, CSV, XLSX albo API. Odbiorca decyduje o formacie, nie o infrastrukturze.

Częstotliwość odświeżania i wymagana świeżość

Monitoring cen w retailu ma inny cykl niż aktualizacja bazy firm. Odświeżanie dobowe wystarcza dla danych rejestrowych i katalogowych, godzinowe bywa konieczne przy promocjach i dostępności magazynowej. Wyższa częstotliwość w modelu pay-per-request przekłada się liniowo na koszt żądań, w modelu zarządzanym mieści się w zakresie umowy.

Struktura kosztu i jego przewidywalność

Rozliczenie za żądanie jest kosztem zmiennym i rośnie wraz z liczbą blokad oraz ponowień — im trudniejsza domena, tym więcej retry na jeden pozyskany rekord. Model usługowy przenosi to ryzyko na dostawcę w zamian za cenę ustaloną dla zdefiniowanego zakresu. Do budżetu własnego scrapera należy doliczyć czas inżyniera, nie tylko rachunek za proxy.

Zgodność prawna i podział odpowiedzialności

RODO obowiązuje od 25 maja 2018 roku, akt o usługach cyfrowych (rozporządzenie 2022/2065) stosuje się w pełni od 17 lutego 2024. Przy danych zawierających informacje o osobach fizycznych znaczenie ma umowa powierzenia przetwarzania i wskazanie podstawy prawnej. Dostawca zarządzany zwykle podpisuje ją jako procesor, dostawca infrastruktury pozostawia rolę administratora po stronie klienta.

Jednorazowość kontra ciągłość zlecenia

Jednorazowy zrzut kilkuset rekordów ma inną ekonomikę niż zasilanie hurtowni przez 24 miesiące. Przy zadaniu jednorazowym narzut na specyfikację, wycenę i odbiór przewyższa koszt samego pobrania. To jedyne kryterium, w którym self-service wygrywa niezależnie od pozostałych warunków.

Porównanie

KryteriumZyteDataMiners
Model dostarczaniaPlatforma self-service: Zyte API, proxy, Scrapy Cloud. Klient konfiguruje i uruchamia.Usługa zarządzana. Klient odbiera dataset, nie konfiguruje narzędzia.
Czas do pierwszego rekorduRejestracja i pierwsze żądanie tego samego dnia, bez rozmowy handlowej.Bezpłatna wycena w 24 h robocze, następnie wdrożenie. Brak trybu self-service.
Ekosystem open sourceScrapy na licencji BSD, ponad 50 tys. gwiazdek na GitHubie, publiczna dokumentacja i społeczność od 2010 roku.Brak własnego frameworka i publicznej dokumentacji technicznej.
Zasięg geograficzny proxyPule adresów i geolokalizacja w kilkudziesięciu krajach, w tym rynki poza Europą.Koncentracja na źródłach polskich i europejskich.
Źródła polskie i lokalne (KRS, CEIDG, Allegro, OLX, katalogi branżowe)Obsługa generyczna. Logikę ekstrakcji dla polskich serwisów przygotowuje klient.Źródła obsługiwane na zamówienie, bez ograniczenia do listy gotowych integracji.
Kto pisze i utrzymuje parseryKlient — chyba że wybierze osobną ofertę Zyte Data.DataMiners, w ramach jednej umowy.
Formaty odbioruOdpowiedzi API (HTML, JSON, dane produktowe). Warstwa ETL po stronie klienta.JSON, CSV, XLSX albo API. Bez dodatkowego przetwarzania po stronie odbiorcy.
Jednorazowe pobranie kilkuset rekordówOpłacalne. Rozliczenie za żądania, bez zobowiązania długoterminowego.Nieopłacalne. Narzut na specyfikację i wycenę przewyższa wartość zlecenia.
Struktura kosztuKoszt zmienny, zależny od liczby żądań i ponowień przy blokadach.Cena indywidualna dla zdefiniowanego zakresu i częstotliwości, bez zależności od liczby retry.

Kiedy lepszym wyborem jest Zyte

  • Organizacja ma zespół Pythonowy pracujący w Scrapy. Framework jest utrzymywany przez Zyte od 2010 roku, więc kompetencja przekłada się bezpośrednio na czas wdrożenia, a warstwa API zastępuje jedynie najtrudniejszy element — obchodzenie blokad.
  • Zadanie jest jednorazowe albo eksploracyjne: kilkaset rekordów, proof of concept, weryfikacja hipotezy przed budżetowaniem projektu. Rozliczenie za żądania i start bez umowy wygrywają tu z każdym modelem usługowym, łącznie z DataMiners.
  • Projekt obejmuje wiele rynków poza Europą i wymaga geolokalizacji w kilkudziesięciu krajach jednocześnie. Zasięg puli adresowej jest w tym scenariuszu przewagą infrastrukturalną, której dostawca skoncentrowany na Polsce i Unii nie odtworzy.
  • Wymóg compliance nakazuje, aby dane nie opuszczały infrastruktury klienta, a logika ekstrakcji pozostała w jego repozytorium. Model API zachowuje pełną kontrolę nad kodem i miejscem przechowywania; usługa zarządzana z definicji wprowadza podmiot przetwarzający.

Kiedy lepszym wyborem jest DataMiners

  • Odbiorcą danych jest analityk lub dział zakupów, nie zespół inżynierski. Plik XLSX albo CSV trafia bezpośrednio do arkusza i modelu biznesowego, bez etapu budowy warstwy ETL.
  • Źródła są polskie, europejskie albo nietypowe: rejestry publiczne, portale branżowe, serwisy z formularzami sesyjnymi, dokumenty PDF. Zakres nie ogranicza się do listy gotowych integracji, a nowe źródło wchodzi na zamówienie.
  • Zasilanie ma charakter ciągły — odświeżanie dobowe lub godzinowe przez wiele miesięcy — i potrzebny jest jeden punkt odpowiedzialności za awarię pipeline'u. Zmiana struktury strony przestaje wtedy być incydentem po stronie klienta.
  • Wymagana jest umowa powierzenia przetwarzania z podmiotem działającym w polskiej jurysdykcji, z komunikacją i dokumentacją po polsku. Dotyczy to zwłaszcza zbiorów zawierających dane osób fizycznych w rozumieniu RODO.

Najczęściej zadawane pytania

Czy Zyte jest tańsze niż własny scraper?

Zależy od horyzontu i trudności źródeł. Zyte rozlicza się za żądania, więc przy niskim wolumenie koszt jest niższy niż etat inżyniera. Przy pipeline'ach działających kwartałami rachunek odwraca się w momencie, gdy liczba ponowień przy blokadach rośnie — Imperva w Bad Bot Report 2024 raportowała 32% ruchu botowego i coraz agresywniejsze filtrowanie, co bezpośrednio zwiększa liczbę płatnych żądań na jeden pozyskany rekord. Własny scraper ma niższy koszt krańcowy i wyższy koszt stały. Proporcja rozstrzyga.

Czy Zyte ma usługę zarządzaną, czy tylko API?

Ma oba modele. Poza Zyte API, Smart Proxy Manager i Scrapy Cloud firma prowadzi ofertę zarządzanego dostarczania danych (Zyte Data), w której parsery utrzymuje dostawca. Porównanie z DataMiners w tym wariancie nie dotyczy więc różnicy narzędzie kontra usługa, lecz pokrycia źródeł: Zyte optymalizuje pod domeny globalne, DataMiners pod polskie i europejskie oraz pod źródła spoza gotowego katalogu.

Czy scrapowanie stron jest legalne w Polsce?

Pobieranie publicznie dostępnych treści nie jest w polskim prawie zakazane wprost, ale ograniczają je trzy odrębne reżimy: RODO (obowiązuje od 25 maja 2018) przy danych osób fizycznych, ochrona baz danych z ustawy z 27 lipca 2001, oraz regulamin serwisu jako stosunek umowny. Akt o usługach cyfrowych, stosowany w pełni od 17 lutego 2024, dodał obowiązki po stronie platform, nie po stronie pobierających. Ocena jest zawsze indywidualna dla konkretnego źródła i celu przetwarzania i wymaga opinii prawnej, a nie interpretacji dostawcy.

Ile trwa zbudowanie własnego scrapera od zera?

Prototyp pojedynczej domeny w Scrapy powstaje w kilka dni roboczych. Produkcyjny pipeline to inna kategoria pracy: rotacja adresów, kolejkowanie, deduplikacja, monitoring, alerty i obsługa zmian w strukturze strony. Dominującą pozycją w budżecie nie jest budowa, tylko utrzymanie — dyżur, który trwa tak długo, jak długo dane mają być świeże.

W jakich formatach i jak często DataMiners dostarcza dane?

Formaty to JSON, CSV, XLSX albo dedykowane API. Odświeżanie odbywa się w cyklu dobowym lub godzinowym, ustalanym dla konkretnego zakresu. Cena jest indywidualna i zależy od liczby źródeł oraz częstotliwości; bezpłatna wycena wraca w ciągu 24 godzin roboczych. Model nie obejmuje trybu self-service, więc przy jednorazowym pobraniu kilkuset rekordów tańsze pozostaje rozwiązanie rozliczane za żądania.

Nie wiesz, który model pasuje do Twojego przypadku? Opisz, jakich danych potrzebujesz i w jakim cyklu — odpowiadamy w 24 h roboczych. Bezpłatna wycena.