Chuyển đến nội dung chính

Bài đăng

Hiển thị các bài đăng có nhãn Parquet

Parquet: Vũ Khí Bí Mật Đằng Sau Các Truy Vấn Big Data Siêu Nhanh

Giới thiệu về Parquet: Định dạng file tối ưu cho dữ liệu lớn Giới thiệu về Parquet Chào các bạn! Hôm nay mình muốn chia sẻ với các bạn về Parquet – một định dạng file mã nguồn mở cực kỳ đỉnh cao, được sinh ra để xử lý những bộ dữ liệu khổng lồ. Khác với các kiểu lưu trữ truyền thống theo hàng (row-based), Parquet lưu dữ liệu theo cột (columnar), giúp việc nén và truy vấn dữ liệu nhanh hơn hẳn. Nó được dùng rất nhiều trong các hệ thống như Apache Spark , Apache Hive , và cả loạt công cụ phân tích dữ liệu khác. Để hiểu Parquet hoạt động thế nào, cùng mình khám phá qua đoạn code đơn giản dưới đây nhé: import pyarrow as pa import pyarrow.parquet as pq import random # Đặt số hàng, số nhóm hàng và số hàng trong mỗi nhóm num_rows = 1_000_000 # 1 triệu hàng num_row_groups = 10 # 10 nhóm rows_per_group = num_rows // num_row_groups # 100.000 hàng...