DT Data Tools

Przeglądarka Parquet — Otwieraj pliki Parquet online, prywatnie

Przeglądaj pliki Apache Parquet w przeglądarce: schemat, typy kolumn, liczba wierszy i wiersze podzielone na strony. Eksportuj Parquet do CSV lub JSON bez wysyłania czegokolwiek.

🔒 Działa całkowicie w Twojej przeglądarce — nic nie jest przesyłane

Drop a .parquet file here or click to browse

Opened locally with DuckDB-wasm. Nothing is uploaded.

The DuckDB engine (about 35 MB) downloads from this site on first use, then runs offline in your browser.

Advertisement

Szybki sposób, by zajrzeć do plików Parquet

Apache Parquet to domyślny format przechowywania danych w data lake'ach, zadaniach Spark, eksportach z pandas i wielu potokach analitycznych. Jest zwarty i szybki, ale to binarny format kolumnowy, więc nie da się go otworzyć w edytorze tekstu ani w arkuszu kalkulacyjnym. Ta Przeglądarka Parquet otwiera plik .parquet bezpośrednio w przeglądarce i pokazuje, co jest w środku: nazwy i typy kolumn, łączną liczbę wierszy, liczbę grup wierszy, bibliotekę, która zapisała plik, oraz tabelę z rzeczywistymi danymi podzieloną na strony.

Pod spodem narzędzie korzysta z DuckDB skompilowanego do WebAssembly. DuckDB natywnie odczytuje Parquet, w tym kompresję Snappy, Gzip i Zstd, zagnieżdżone listy i struktury, daty, znaczniki czasu i liczby dziesiętne. Liczba wierszy pochodzi z metadanych pliku, a każda strona jest pobierana niewielkim zapytaniem LIMIT/OFFSET, dzięki czemu przeglądanie pozostaje płynne nawet wtedy, gdy plik ma miliony wierszy.

Konwersja Parquet do CSV lub JSON

Często po prostu potrzebujesz danych w wygodniejszym formacie. Przyciski eksportu konwertują cały plik, a nie tylko widoczną stronę. Eksport do CSV zapisuje wiersz nagłówka, a po nim wszystkie rekordy – gotowe do Excela, Google Sheets lub importu do bazy danych. Eksport do JSON zapisuje jedną tablicę obiektów, co jest wygodne w skryptach, danych testowych i API. Zagnieżdżone kolumny pozostają zagnieżdżonym JSON-em, a w CSV pojawiają się jako tekst. Znaczniki czasu są zapisywane w formacie ISO, aby poprawnie się sortowały i parsowały.

Prywatna analiza, przyjazna pracy offline

Pliki Parquet często zawierają dane produkcyjne: rekordy użytkowników, transakcje lub telemetrię. Wysyłanie ich na nieznaną stronę tylko po to, by zerknąć na schemat, jest ryzykowne. Tutaj plik jest wczytywany do pamięci przeglądarki i nigdy nigdzie nie trafia. Silnik DuckDB (około 35 MB) jest pobierany z sieci CDN przy pierwszym otwarciu pliku, a następnie może zostać zapisany w pamięci podręcznej przeglądarki. Ponieważ cały plik jest przechowywany w pamięci, obsługa bardzo dużych plików zależy od ilości RAM dostępnej dla karty przeglądarki. Do głębszej analizy, takiej jak filtry, agregacje czy złączenia z innymi plikami, otwórz ten sam plik w narzędziu SQL on CSV.

Jak używać

  1. Otwórz plik ParquetUpuść plik .parquet w obszarze upuszczania lub kliknij, aby wybrać go z komputera.
  2. Sprawdź schematPrzejrzyj nazwy kolumn, typy DuckDB, dopuszczalność wartości null, liczbę wierszy i metadane pliku.
  3. Przeglądaj wierszeWybierz rozmiar strony i przechodź między stronami lub przejdź od razu do wybranego numeru strony.
  4. EksportujPobierz wszystkie wiersze jako CSV do arkuszy kalkulacyjnych lub jako tablicę JSON do kodu.

Najczęściej zadawane pytania

Czy mój plik Parquet jest wysyłany na serwer?
Nie. Plik jest otwierany w przeglądarce za pomocą DuckDB skompilowanego do WebAssembly. Silnik jest pobierany z sieci CDN, a Twoje dane pozostają na Twoim urządzeniu.
Jakie funkcje formatu Parquet są obsługiwane?
DuckDB odczytuje popularne kompresje, takie jak Snappy, Gzip i Zstd, typy zagnieżdżone, takie jak listy i struktury, a także daty, znaczniki czasu i liczby dziesiętne.
Czy mogę wyeksportować cały plik, a nie tylko bieżącą stronę?
Tak. Eksport do CSV lub JSON zawsze zapisuje wszystkie wiersze pliku, niezależnie od tego, którą stronę aktualnie przeglądasz.
Dlaczego zagnieżdżone kolumny są wyświetlane jako tekst JSON?
Listy i struktury nie mieszczą się w pojedynczej komórce płaskiej tabeli, dlatego przeglądarka pokazuje je jako zwarty JSON. Eksport do JSON zachowuje ich zagnieżdżenie.
Advertisement