BigQuery to bezserwerowa hurtownia danych Google Cloud, w której zapytania pisze się w zwykłym SQL, a infrastruktury nie trzeba konfigurować w ogóle. Wpisujesz zapytanie, dostajesz wynik, płacisz za przeskanowane dane.
Dla większości ludzi to narzędzie korporacyjne i nic więcej. Ale jest jeden powód, dla którego to hasło trafiło do słownika tradera: BigQuery hostuje kompletne publiczne zbiory danych blockchainowych. Cała historia Bitcoina i Ethereum – każdy blok, każda transakcja, każdy adres – dostępna do przepytania SQL-em. W ramach darmowego limitu, bez karty kredytowej.
Jeśli kiedykolwiek chciałeś sprawdzić coś on-chain samodzielnie, zamiast wierzyć wykresowi z Twittera, to jest właśnie to miejsce.
Jak to działa
Trzy rzeczy odróżniają BigQuery od zwykłej bazy danych.
Bezserwerowość. Nie stawiasz maszyny, nie dobierasz mocy, nie martwisz się skalowaniem. Piszesz SQL, Google rozdziela pracę na swoją infrastrukturę i zwraca wynik. Zapytanie na kilkuset gigabajtach potrafi się wykonać w kilka sekund.
Magazyn kolumnowy. Dane nie leżą wierszami, tylko kolumnami. Dlatego skanowanie jednej kolumny z tabeli mającej ich pięćdziesiąt kosztuje ułamek tego, co skanowanie całości. To będzie za chwilę bardzo ważne.
Rozdzielenie mocy obliczeniowej od magazynu. Płacisz osobno za przechowywanie danych i osobno za ich przetwarzanie. To sprawia, że trzymanie ogromnych zbiorów jest tanie, a drogie robi się dopiero nierozważne odpytywanie.
Ile to kosztuje – i gdzie ludzie tracą pieniądze
Model rozliczeń jest nietypowy i to jest najważniejsza rzecz do zrozumienia w całym haśle.
Nie płacisz za czas obliczeń. Płacisz za liczbę przeskanowanych bajtów.
Darmowy poziom obejmuje 1 TB zapytań i 10 GB magazynu miesięcznie. Powyżej tego rozliczenie na żądanie kosztuje 6,25 USD za skanowany TiB. Magazyn to 0,02 USD za GB miesięcznie dla danych aktywnych, spadające do około 0,01 USD dla danych nietkniętych przez 90 dni.
Darmowy sandbox nie wymaga karty kredytowej i obejmuje dostęp do publicznych zbiorów danych. Dla kogoś, kto chce się pobawić danymi blockchainowymi, to jest wystarczające na długo.
A teraz pułapka. Pojedyncze SELECT * na tabeli o rozmiarze 10 TiB kosztuje 62,50 USD. Źle napisany pulpit odświeżany co godzinę potrafi kosztować setki dolarów dziennie.
Do tego rzecz, która zaskakuje wszystkich za pierwszym razem: koszt zapytania naliczany jest nawet przy użyciu klauzuli LIMIT, a minimalna opłata wynosi 10 MB na każdą odpytywaną tabelę.
Przeczytaj to jeszcze raz, bo to jest sedno. SELECT * FROM tabela LIMIT 10 skanuje całą tabelę. LIMIT ogranicza to, co zobaczysz, a nie to, co zostanie przeskanowane i policzone. Ludzie robią tak z przyzwyczajenia z innych baz i dostają rachunek.
Cztery rzeczy, które trzeba robić od pierwszego dnia:
- Wybieraj kolumny, nigdy
SELECT *. W tabelach blockchainowych bywa ich kilkadziesiąt, a potrzebujesz trzech. - Filtruj po dacie. Tabele są partycjonowane po czasie bloku – ograniczenie zakresu dat obcina koszt proporcjonalnie.
- Sprawdzaj estymatę przed uruchomieniem. Konsola pokazuje przewidywaną liczbę bajtów do przeskanowania, zanim klikniesz. Zawsze na to patrz.
- Ustaw limit
maximum bytes billed. To twardy bezpiecznik – zapytanie przekraczające próg po prostu się nie wykona zamiast wygenerować rachunek.
Dorzucę jeszcze jedną: BigQuery ML przy bardziej zaawansowanych modelach kosztuje 312,50 USD za TiB. Zanim uruchomisz cokolwiek z tej rodziny, policz najpierw rozmiar danych.
Publiczne zbiory blockchainowe – po co Ci to
Tu jest realna wartość dla kogoś z rynku krypto.
Google udostępnia w projekcie bigquery-public-data pełne, regularnie aktualizowane zbiory danych z łańcuchów blokowych. Pierwsze były Bitcoin i Ethereum, potem dołączyły Bitcoin Cash, Dash, Dogecoin, Ethereum Classic, Litecoin i Zcash – z ujednoliconym schematem, który pozwala robić analizy porównawcze między łańcuchami. Wszystkie aktualizowane są co 24 godziny przez wspólną infrastrukturę Blockchain ETL.
W 2023 roku doszło jedenaście kolejnych łańcuchów. Google dorzucił też pierwszostronny zbiór zarządzany przez siebie – goog_blockchain_ethereum_mainnet – z gotowymi tabelami zdarzeń, pozwalającymi łatwo odpytywać salda portfeli, transfery konkretnych tokenów (ERC20, ERC721, ERC1155) i interakcje z kontraktami. Do zbioru bitcoinowego dodano satoshi i Ordinals.
Nazwy tabel wyglądają tak: bigquery-public-data.crypto_bitcoin.transactions, bigquery-public-data.crypto_ethereum.transactions, .blocks, .balances, .token_transfers.
Przykładowe zapytanie – liczba transakcji Bitcoina dziennie w ostatnim miesiącu:
SELECT DATE(block_timestamp) AS dzien, COUNT(*) AS transakcje
FROM `bigquery-public-data.crypto_bitcoin.transactions`
WHERE block_timestamp >= TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL 30 DAY)
GROUP BY dzien
ORDER BY dzien;
Zwróć uwagę na filtr czasowy – bez niego to samo zapytanie skanowałoby całą historię łańcucha.
Gotowych zapytań nie trzeba zresztą wymyślać od zera. Projekt Blockchain ETL utrzymuje na GitHubie repozytorium awesome-bigquery-views z gotowymi widokami SQL do tych zbiorów.
Co da się z tego wyciągnąć, a czego nie
Uczciwie, bo tu jest sporo rozczarowań.
Co jest w danych on-chain:
- liczba aktywnych adresów i tempo przyrostu nowych
- rozkład wielkości transakcji – czy rusza się drobnica, czy wieloryby
- koncentracja posiadania na adresach
- aktywność tokenów ERC-20 i kontraktów
- opłaty, przepustowość, czasy bloków
- przepływy na konkretne adresy, jeśli wiesz, do kogo należą
Czego w nich nie ma – i to jest ważniejsze:
- Transakcji z giełd scentralizowanych. Kupno bitcoina na Binance czy MEXC nie zostawia śladu w łańcuchu. Widzisz tylko wpłaty i wypłaty, nie sam handel. Ogromna część realnego wolumenu jest niewidoczna.
- Etykiet adresów. Surowy zbiór nie mówi, który portfel należy do giełdy, a który do funduszu. Bez etykiet „przepływy na giełdy” są nie do policzenia, a właśnie te etykiety są głównym produktem płatnych dostawców.
- Tożsamości. Jeden podmiot może mieć tysiąc adresów. Adres to nie osoba i wyciąganie wniosków o „liczbie użytkowników” na tej podstawie to najczęstszy błąd analizy on-chain.
Wniosek praktyczny: BigQuery daje Ci surowiec, nie gotowy wskaźnik. To jest zaleta, bo możesz sprawdzić coś samodzielnie, i wada, bo wymaga pracy i wiedzy o tym, co właściwie liczysz.
Alternatywy, jeśli nie chcesz pisać SQL-a: Dune Analytics (darmowy, gotowe pulpity i społecznościowe zapytania), Glassnode i Nansen (płatne, gotowe wskaźniki i etykiety adresów), Bitquery (API). Każde z nich w jakimś stopniu robi to, co możesz zrobić sam – tylko szybciej i za pieniądze.
Cztery mity
Mit 1: „Analiza on-chain pokazuje, co się stanie z ceną.” Pokazuje, co się wydarzyło w łańcuchu. To jest kontekst, nie prognoza. Znacząca część rynku – handel na giełdach scentralizowanych, kontrakty, derywaty – w ogóle się tam nie odbija.
Mit 2: „BigQuery jest darmowy.” Do 1 TB zapytań miesięcznie tak. Powyżej płacisz za skanowane bajty i przy nieostrożnych zapytaniach robi się to szybko kosztowne.
Mit 3: „LIMIT ogranicza koszt.” Nie. Ogranicza wynik, nie skanowanie. To jest najdroższe nieporozumienie w tym narzędziu.
Mit 4: „Liczba adresów to liczba użytkowników.” Nie ma między tym prostego przełożenia. Jeden użytkownik tworzy dowolnie wiele adresów, a giełdy obsługują miliony klientów z garstki portfeli.
Jak sam na to patrzę
Nie jestem analitykiem on-chain i nie buduję na tym strategii. Ale wartość tego narzędzia widzę w czymś innym i myślę, że to jest istota sprawy.
Rynek krypto jest zalany wykresami, których nikt nie weryfikuje. Ktoś publikuje „rekordowe przepływy na giełdy”, tysiąc osób podaje dalej, nikt nie pyta, jak to policzono ani które adresy uznano za giełdowe. Możliwość samodzielnego sprawdzenia surowych danych jest jedynym lekarstwem na taki obieg informacji.
Nie musisz robić tego codziennie. Wystarczy zrobić raz, żeby przekonać się, ile założeń kryje się za każdym „wskaźnikiem on-chain”, który potem czytasz jako fakt. Po tym doświadczeniu ogląda się te wykresy zupełnie inaczej.
Do tego dochodzi rzecz banalna, ale przydatna: jeśli prowadzisz jakiekolwiek własne zestawienia – historię transakcji, dziennik, dane z API giełd – BigQuery jest sensownym miejscem, żeby to trzymać i przepytywać, zamiast męczyć się z arkuszem, który przestaje działać przy stu tysiącach wierszy.
Co zapamiętać
BigQuery to bezserwerowa hurtownia danych Google Cloud rozliczana za przeskanowane bajty – 6,25 USD za TiB, z pierwszym terabajtem miesięcznie za darmo i sandboxem niewymagającym karty.
Dla rynku krypto istotne jest jedno: hostuje kompletne, codziennie aktualizowane publiczne zbiory danych blockchainowych – Bitcoin, Ethereum i kilkanaście innych łańcuchów – które możesz odpytywać zwykłym SQL-em.
Trzy zasady na start: nigdy SELECT *, zawsze filtr po dacie, ustaw limit rozliczanych bajtów. I pamiętaj, że dane on-chain to surowiec, nie sygnał – a wszystko, co dzieje się na giełdach scentralizowanych, pozostaje poza ich zasięgiem.


