Просмотрщик Parquet — открывайте файлы Parquet онлайн, конфиденциально
Просматривайте файлы Apache Parquet в браузере: схема, типы столбцов, число строк и постраничный вывод. Экспортируйте Parquet в CSV или JSON без загрузки на сервер.
🔒 Работает полностью в вашем браузере — ничего не загружаетсяБыстрый способ заглянуть внутрь файлов Parquet
Apache Parquet — стандартный формат хранения для озёр данных, заданий Spark, экспорта из pandas и множества аналитических конвейеров. Он компактный и быстрый, но это двоичный столбцовый формат, поэтому открыть его в текстовом редакторе или электронной таблице не получится. Этот Просмотрщик Parquet открывает файл .parquet прямо в браузере и показывает, что внутри: имена и типы столбцов, общее число строк, количество групп строк, библиотеку, которая записала файл, а также постраничную таблицу с фактическими данными.
Под капотом инструмент использует DuckDB, скомпилированную в WebAssembly. DuckDB читает Parquet нативно, включая сжатие Snappy, Gzip и Zstd, вложенные списки и структуры, даты, метки времени и десятичные числа. Число строк берётся из метаданных файла, а каждая страница загружается небольшим запросом LIMIT/OFFSET, поэтому просмотр остаётся отзывчивым даже тогда, когда в файле миллионы строк.
Конвертируйте Parquet в CSV или JSON
Часто данные просто нужны в более удобном формате. Кнопки экспорта конвертируют весь файл, а не только видимую страницу. Экспорт в CSV записывает строку заголовков, за которой следуют все записи, — готово для Excel, Google Sheets или импорта в базу данных. Экспорт в JSON записывает единый массив объектов, что удобно для скриптов, тестовых данных и API. Вложенные столбцы сохраняются как вложенный JSON, а в CSV они выводятся как текст. Метки времени записываются в формате ISO, чтобы корректно сортироваться и разбираться.
Конфиденциальный просмотр, удобный и без сети
Файлы Parquet часто содержат рабочие данные: записи пользователей, транзакции или телеметрию. Загружать их на незнакомый сайт только ради того, чтобы взглянуть на схему, рискованно. Здесь файл считывается в память вашего браузера и никуда не отправляется. Движок DuckDB (около 35 МБ) загружается с CDN при первом открытии файла, после чего браузер может его закэшировать. Поскольку весь файл хранится в памяти, работа с очень большими файлами зависит от объёма оперативной памяти, доступной вкладке браузера. Для более глубокого анализа — фильтров, агрегаций или объединений с другими файлами — откройте тот же файл в инструменте SQL on CSV.
Как использовать
- Откройте файл ParquetПеретащите файл .parquet в область загрузки или нажмите, чтобы выбрать его на компьютере.
- Изучите схемуПросмотрите имена столбцов, типы DuckDB, допустимость NULL, число строк и метаданные файла.
- Листайте строкиВыберите размер страницы и переходите между страницами или сразу к нужному номеру страницы.
- ЭкспортируйтеСкачайте все строки в CSV для электронных таблиц или в виде массива JSON для кода.