DT Data Tools

Просмотрщик Parquet — открывайте файлы Parquet онлайн, конфиденциально

Просматривайте файлы Apache Parquet в браузере: схема, типы столбцов, число строк и постраничный вывод. Экспортируйте Parquet в CSV или JSON без загрузки на сервер.

🔒 Работает полностью в вашем браузере — ничего не загружается

Drop a .parquet file here or click to browse

Opened locally with DuckDB-wasm. Nothing is uploaded.

The DuckDB engine (about 35 MB) downloads from this site on first use, then runs offline in your browser.

Advertisement

Быстрый способ заглянуть внутрь файлов Parquet

Apache Parquet — стандартный формат хранения для озёр данных, заданий Spark, экспорта из pandas и множества аналитических конвейеров. Он компактный и быстрый, но это двоичный столбцовый формат, поэтому открыть его в текстовом редакторе или электронной таблице не получится. Этот Просмотрщик Parquet открывает файл .parquet прямо в браузере и показывает, что внутри: имена и типы столбцов, общее число строк, количество групп строк, библиотеку, которая записала файл, а также постраничную таблицу с фактическими данными.

Под капотом инструмент использует DuckDB, скомпилированную в WebAssembly. DuckDB читает Parquet нативно, включая сжатие Snappy, Gzip и Zstd, вложенные списки и структуры, даты, метки времени и десятичные числа. Число строк берётся из метаданных файла, а каждая страница загружается небольшим запросом LIMIT/OFFSET, поэтому просмотр остаётся отзывчивым даже тогда, когда в файле миллионы строк.

Конвертируйте Parquet в CSV или JSON

Часто данные просто нужны в более удобном формате. Кнопки экспорта конвертируют весь файл, а не только видимую страницу. Экспорт в CSV записывает строку заголовков, за которой следуют все записи, — готово для Excel, Google Sheets или импорта в базу данных. Экспорт в JSON записывает единый массив объектов, что удобно для скриптов, тестовых данных и API. Вложенные столбцы сохраняются как вложенный JSON, а в CSV они выводятся как текст. Метки времени записываются в формате ISO, чтобы корректно сортироваться и разбираться.

Конфиденциальный просмотр, удобный и без сети

Файлы Parquet часто содержат рабочие данные: записи пользователей, транзакции или телеметрию. Загружать их на незнакомый сайт только ради того, чтобы взглянуть на схему, рискованно. Здесь файл считывается в память вашего браузера и никуда не отправляется. Движок DuckDB (около 35 МБ) загружается с CDN при первом открытии файла, после чего браузер может его закэшировать. Поскольку весь файл хранится в памяти, работа с очень большими файлами зависит от объёма оперативной памяти, доступной вкладке браузера. Для более глубокого анализа — фильтров, агрегаций или объединений с другими файлами — откройте тот же файл в инструменте SQL on CSV.

Как использовать

  1. Откройте файл ParquetПеретащите файл .parquet в область загрузки или нажмите, чтобы выбрать его на компьютере.
  2. Изучите схемуПросмотрите имена столбцов, типы DuckDB, допустимость NULL, число строк и метаданные файла.
  3. Листайте строкиВыберите размер страницы и переходите между страницами или сразу к нужному номеру страницы.
  4. ЭкспортируйтеСкачайте все строки в CSV для электронных таблиц или в виде массива JSON для кода.

Часто задаваемые вопросы

Загружается ли мой файл Parquet на сервер?
Нет. Файл открывается в вашем браузере с помощью DuckDB, скомпилированной в WebAssembly. Движок загружается с CDN, а ваши данные остаются на вашем устройстве.
Какие возможности Parquet поддерживаются?
DuckDB читает распространённые виды сжатия, такие как Snappy, Gzip и Zstd, вложенные типы вроде списков и структур, а также даты, метки времени и десятичные числа.
Можно ли экспортировать весь файл, а не только текущую страницу?
Да. Экспорт в CSV или JSON всегда записывает все строки файла, независимо от того, какую страницу вы просматриваете.
Почему вложенные столбцы отображаются как текст JSON?
Списки и структуры не помещаются в одну ячейку плоской таблицы, поэтому просмотрщик показывает их как компактный JSON. Экспорт в JSON сохраняет их вложенность.
Advertisement