Blog
Lập trình

Can We Agree on a Storage/Workload Architecture Taxonomy?

3 phut doc0 luot xem

KẾT LUẬN

Bài viết đề xuất một bảng phân loại (taxonomy) cho kiến trúc lưu trữ và workload, giúp làm rõ các mô hình OLTP, OLAP, HTAP và LTAP đang ngày càng chồng lấn. Tác giả kêu gọi cộng đồng thống nhất từ vựng chung để mô tả chính xác cách hệ thống, tầng lưu trữ, khả năng hiển thị dữ liệu và số bản sao bền vững liên quan đến nhau.

LUẬN ĐIỂM CHÍNH

  • Sự phân biệt giữa OLTP, OLAP, HTAP và LTAP đang trở nên mờ nhạt, đòi hỏi một hệ thống phân loại thống nhất để mô tả các kiến trúc khác nhau.
  • Hai khái niệm then chốt trong phân loại là Tiering (di chuyển dữ liệu giữa tầng nóng/lạnh) và Materializing (sao chép dữ liệu giữa các hệ thống), khác biệt bởi số lượng bản sao bền vững.
  • HTAP là hệ thống đơn lẻ phục vụ cả hai workload với dữ liệu hiển thị đồng thời; LTAP là sự thống nhất dữ liệu giữa hai hệ thống riêng biệt qua tầng lưu trữ dùng chung, mang tính bất đồng bộ.
  • Câu hỏi về số bản sao dữ liệu (zero-copy, one-copy) bị tác giả chỉ trích là chiêu trò marketing — thực tế phức tạp hơn nhiều với các chính sách hết hạn dữ liệu độc lập giữa các hệ thống.

LUẬN ĐIỂM PHỤ

  • Các danh mục giả thuyết như Shared-Sync-RR (một hệ thống ghi, một đọc) và Shared-Sync-MM (cả hai cùng ghi) có thể xuất hiện khi các hệ thống tiến tới đồng bộ hóa lưu trữ thời gian thực.
  • Tài liệu marketing thường bỏ qua sự khác biệt về mô hình dữ liệu: 3NF cho OLTP và Kimball star schema cho OLAP — đây là một chiều phân tích quan trọng bổ sung cho taxonomy.
  • Trong Shared Tiering, mức độ trùng lặp dữ liệu là một núm vặn có thể điều chỉnh — từ không có bản sao nào (evict ngay khi tiered) đến nhiều dữ liệu chồng lấn để tối ưu hiệu năng.

LUẬN CỨ & VÍ DỤ

  • Apache Kafka tiered storage và ClickHouse MergeTree là ví dụ cho Internal Tiering: một hệ thống, một workload, phân tầng SSD (nóng) và S3 (lạnh).
  • SingleStore và TiDB/TiFlash minh họa hai tiểu loại HTAP: freshness-by-composition (ghi đồng bộ cả row-based và columnar) và freshness-by-catchup (sao chép bất đồng bộ, chỉ phục vụ truy vấn khi column-store bắt kịp LSN).
  • Databricks LTAP và Apache Fluss là ví dụ cho Shared Tiering: dữ liệu nóng nằm ở System A (Fluss servers), dữ liệu lạnh hơn được chia sẻ qua lakehouse cho cả System A và B.

Nguồn: Data Engineering Weekly | Phân tích bởi AI

Ban thay bai viet nay the nao?

Bình luận (0)

Bài viết liên quan

Gợi ý dựa trên điểm tương quan phân cấp và danh mục chung

Ngưỡng tương quan tối thiểu:30%
Tất cả (0%)Tương quan mạnh (70%+)

Không có bài viết nào đạt ngưỡng tương quan này. Hãy thử kéo thanh trượt sang trái.

--- Het ---