Presentation: Chaos Engineering GPU Clusters
KẾT LUẬN Bài trình bày của Bryan Oliver (Thoughtworks) lập luận rằng các cụm GPU quy mô lớn cho AI/ML đã đạt đến mức độ phức tạp vượt xa hạ tầng truyền thống, đòi hỏi phải áp dụng Chaos Engineering để kiểm thử khả năng phục hồi — từ lỗi GPU, suy giảm hiệu năng mạng RDMA/InfiniBand, đến thermal throttling và sai lệch NUMA.