Cloudflare Details Unified Data Platform Where Billing Workloads Account for 53% of Queries
KẾT LUẬN
Cloudflare đã xây dựng thành công nền tảng dữ liệu thống nhất nội bộ mang tên Town Lake (data lakehouse dựa trên Trino + Iceberg + R2) cùng AI agent Skipper, giải quyết triệt để bài toán phân mảnh dữ liệu (data sprawl) sau thời kỳ tăng trưởng nhanh. Kết quả ấn tượng nhất: 53% tổng truy vấn trên nền tảng đến từ khối lượng công việc billing – minh chứng cho thấy đây là use case quan trọng bậc nhất và nền tảng đã đáp ứng được yêu cầu khắt khe về độ chính xác, unsampled data. Cách tiếp cận default-closed (đóng-mặc-định) trong bảo mật dữ liệu và kiến trúc AI agent với Code Mode là hai điểm sáng tạo nổi bật.
LUẬN ĐIỂM CHÍNH
- Town Lake – Data Lakehouse thống nhất: Cloudflare xây dựng nền tảng truy vấn duy nhất dùng Apache Trino làm query engine, Apache Iceberg trên R2 làm data catalog, tích hợp đa nguồn (Postgres, ClickHouse, BigQuery, Kafka) – cho phép một câu SQL join xuyên suốt nhiều hệ thống mà không cần materialize dữ liệu trung gian.
- Skipper – AI Data Agent với Code Mode: Skipper cho phép người dùng đặt câu hỏi bằng ngôn ngữ tự nhiên, tự động tìm bảng, viết SQL, chạy truy vấn và trả về kết quả dạng bảng/biểu đồ. Điểm đặc biệt là Code Mode – thay vì định nghĩa 30+ tool riêng lẻ, Skipper chỉ expose 2 tool (search + execute), cho phép model viết JavaScript snippet gọi toàn bộ toolset trong một round-trip, chạy trong sandboxed Worker isolate.
- Governance default-closed: Khác với mô hình mở-mặc-định truyền thống, Town Lake áp dụng đóng-mặc-định – mọi bảng mới đều bị khóa cho đến khi được Skimmer (máy quét PII dùng Workers AI) quét và được người review phê duyệt. PII được redact theo mặc định, chỉ hiển thị khi người dùng chủ động bật và có quyền.
- 53% truy vấn đến từ billing: Trong một kỳ đo gần đây, 91.760 truy vấn từ 324 nhân viên được phục vụ trên Town Lake, trong đó billing chiếm 53% – các truy vấn doanh thu phức tạp 200-300 dòng SQL cũ nay rút gọn còn 5 dòng.
LUẬN ĐIỂM PHỤ
- 5 lớp context chống hallucination cho Skipper: (1) Schema & usage metadata từ DataHub, (2) Human annotations – mô tả bảng do chính team sở hữu viết, (3) Code-derived knowledge – SQL gốc sinh ra bảng từ Transformer pipeline, (4) Curated data models – tài liệu ngắn mô tả cách tư duy về billing/customer/account, (5) Runtime introspection – truy vấn live để kiểm tra khi các lớp trên không đủ.
- Kiến trúc dogfooding: Toàn bộ nền tảng được xây dựng trên chính các sản phẩm của Cloudflare – R2 (lưu trữ), Workers (compute), Access (xác thực), Workflows (orchestration), D1 (state cho Lifeguard), Durable Objects – thể hiện cam kết uống cà phê của chính mình và đồng thời là bài kiểm tra thực tế cho các sản phẩm này.
- Bài học bất ngờ: Less prompting is more (prompt ngắn gọn, để model tự chọn đường đi cho kết quả tốt hơn); Tool overlap là độc hại (gộp tool trùng lặp, mỗi tool chỉ nên có một lý do tồn tại); Code nắm bắt ý nghĩa tốt hơn metadata; Memory layer quan trọng hơn dự kiến; Hạ tầng buồn chán (per-row access control, PII detection, audit) mới là phần khó nhất.
LUẬN CỨ & VÍ DỤ
- Dẫn chứng billing: Billable Usage Dashboard – dashboard hiển thị chi phí cho khách hàng pay-as-you-go – được cung cấp bởi metering pipeline lấy dữ liệu từ Iceberg tables trên R2 qua Trino. API của dashboard dùng cùng dữ liệu (date, account_id, metric_name, usage) với hệ thống lập hóa đơn, đảm bảo con số hiển thị khớp với con số trên bill.
- Dẫn chứng Skipper thực tế: Câu hỏi về top 10 customers by R2 storage cost được Skipper xử lý tự động: tìm bảng qua DataHub, lấy schema và lineage, viết SQL, gửi lên Trino, poll kết quả, hiển thị bảng/biểu đồ; follow-up break it down by region, ignore internal Cloudflare accounts cũng được xử lý liền mạch có giữ context.
- Dẫn chứng Skimmer PII scanner: Skimmer chạy liên tục, lấy mẫu từ mọi cột trong mọi bảng, dùng Workers AI phân loại PII qua 2 pass – pass 1 nhanh theo cột, pass 2 agentic có full context và có thể query Trino để verify. Kết quả đẩy vào DataHub và Lifeguard allowlist, quy trình review chỉ mất vài giây cho mỗi bảng.
Nguồn: InfoQ | Phân tích bởi AI
Ban thay bai viet nay the nao?
Bình luận (0)
Bài viết liên quan
Gợi ý dựa trên điểm tương quan phân cấp và danh mục chung
Không có bài viết nào đạt ngưỡng tương quan này. Hãy thử kéo thanh trượt sang trái.
--- Het ---