Cách hoạt động
Không có giai đoạn nào yêu cầu chuyển giao thủ công — mỗi lớp tự động cung cấp cho lớp tiếp theo:- Thu thập — sự kiện được truyền từ các nguồn như AWS, Datadog, Slack, và PagerDuty vào một feed Pulse duy nhất.
- Lọc và tương quan — các lớp suppression loại bỏ trùng lặp, burst bị giới hạn tốc độ, và tài nguyên flapping. Các tín hiệu liên quan được nhóm thành cluster, nên chín cảnh báo về cùng một node pool trở thành một mục.
- Phân loại và leo thang — mỗi tín hiệu nhận một danh mục, mức độ nghiêm trọng chuẩn, và điểm khả năng hành động. Khi một cluster ở mức Nghiêm trọng hoặc Cao, hoặc AI đánh dấu nó có thể hành động, nó tự động leo thang thành sự cố.
- Điều tra — một agent AI hình thành các giả thuyết rõ ràng, kiểm tra từng giả thuyết dựa trên metrics và logs, và tạo ra báo cáo có cấu trúc: nguyên nhân gốc rễ có khả năng nhất, chuỗi bằng chứng, và các lý thuyết đã loại trừ.
- Giải quyết và ghi nhớ — agent khớp runbooks của bạn với nguyên nhân gốc rễ và thực thi chúng theo chế độ tự trị bạn đặt (Manual hoặc Auto). Mỗi giải pháp đưa vào incident memory, giúp điều tra tiếp theo nhanh hơn.
Những gì bạn có thể làm
Khái niệm chính
Bắt đầu
Connect signal sources
Kết nối AWS, Slack, Teams, và nguồn webhook để bắt đầu cung cấp cho Pulse.
Set up webhook integrations
Định tuyến cảnh báo từ PagerDuty, Datadog, CloudWatch, và nhiều hơn vào vòng lặp phản hồi.
Add runbooks
Cung cấp cho agent các quy trình có thể thực thi trong quá trình khắc phục.
See how investigation works
Theo dõi phân tích nguyên nhân gốc rễ theo giả thuyết từ đầu đến cuối.