Tự động hóa tiếp nhận sự cố với Jira Service Management
Việc tích hợp Jira Service Management (JSM) với hệ thống giám sát hiện có giúp nhóm kỹ sư on-call của SVTECH loại bỏ quy trình phân loại cảnh báo thủ công và tập trung thời gian xử lý sự cố.
Những con số biết nói
Luồng tiếp nhận sự cố, từ cảnh báo đến phân công người xử lý đều được tự động hóa
Thông báo đến kỹ sư on-call ngay lập tức, đảm bảo SLA thời gian phản hồi đầu tiên
Thay vì mất thời gian phân loại cảnh báo, kỹ sư on-call tập trung giải quyết sự cố
SVTECH - 25 năm kiến tạo hạ tầng CNTT cho doanh nghiệp Việt
Thành lập vào năm 2001, SVTECH là một trong các công ty hàng đầu tại Việt Nam cung cấp hạ tầng CNTT toàn diện cho doanh nghiệp. Từ tích hợp hệ thống, quản trị đám mây đến dịch vụ giám sát và vận hành hạ tầng, mỗi giải pháp SVTECH triển khai đều được "may đo" theo nhu cầu thực tế của từng tổ chức.
Bài toán phân mảnh công cụ của hệ thống giám sát sự cố
SVTECH vận hành hạ tầng CNTT phức tạp cho nhiều khách hàng doanh nghiệp. Để giám sát hạ tầng, công ty sử dụng 02 công cụ mã nguồn mở chạy trên môi trường on-premise:
-
Icinga2 cho hạ tầng truyền thống (Server, Network và Storage)
-
Prometheus cho các cụm Kubernetes/Container
Ticket và sự cố được quản lý qua email và bảng tính Excel - không có hệ thống tập trung.
Tháng 06.2026
Hệ thống phân tán khiến đội nhóm kỹ thuật SVTECH đối mặt khó khăn:
-
Icinga2 và Prometheus gửi nhiều thông báo trùng lặp, gây quá tải
-
Kỹ sư on-call mất thời gian trong việc tổng hợp, phân loại mức độ cảnh báo
-
Quy trình tổng hợp, phân loại cảnh báo thủ công dễ gây ra sai sót và chậm trễ
AgileOps triển khai cấu hình và tích hợp Jira Service Management (JSM) với 02 ứng dụng giám sát hạ tầng công ty đang sử dụng.
Triển khai giải pháp quản lý dịch vụ CNTT toàn diện & tổ chức đào tạo
Hiểu rõ nhu cầu của SVTECH, đội ngũ chuyên gia AgileOps thiết kế hệ thống quản lý sự cố tập trung trên nền tảng Jira Service Management. AgileOps khai thác bộ công cụ Operations của JSM để lọc tự động và định tuyến cảnh báo từ Prometheus và Icinga2.
Từ đó, quy trình chuyển đổi từ cảnh báo kỹ thuật thành incident ticket được tự động hóa hoàn toàn. Nhóm kỹ sư on-call nhận thông báo khi có sự cố cần xử lý.
Đồng thời, AgileOps thiết kế kế hoạch đào tạo và tài liệu kỹ thuật, bám sát nhu cầu của SVTECH.
Giải pháp từ AgileOps giúp nhóm kỹ sư on-call SVTECH giảm đáng kể số lượng cảnh báo nhiễu và thao tác phân loại cảnh báo thủ công. Hệ thống tự động phân công kỹ sư theo lịch trực (on-call schedule), từ đó, giúp đảm bảo thời gian phản hồi sự cố lần đầu tiên (SLA first react ticket).
Chuẩn hóa dữ liệu từ hai nguồn không đồng nhất
Thách thức kỹ thuật lớn nhất của dự án là việc mapping data. Prometheus gửi dữ liệu qua JSON/Webhook, trong khi Icinga2 dùng giao thức API. Ngoài ra, hai ứng dụng định nghĩa mức độ ưu tiên sự cố khác nhau, với các trường thông tin không tương thích.
AgileOps đề xuất khai thác bộ tính năng Operations (trước đây là Opsgenie) làm tầng lọc trung gian với 02 cơ chế:
-
Alert suppression gộp các cảnh báo trùng lặp, loại bỏ thông báo nhiễu trước khi gửi đến kỹ sư on-call.
-
Alert aggregation tổng hợp các cảnh báo liên quan vào sự cố duy nhất, thiết lập lệnh automation để thống nhất ID (mã định danh) của cảnh báo lặp.
Trước đây, khi khách hàng gửi email báo sự cố, đội trực mất khoảng 15 phút để đọc, tổng hợp và tạo ticket thủ công cho mỗi trường hợp. Giờ đây, ticket được tạo tự động và gửi thông báo đến kỹ sư qua email hay SMS ngay lập tức.
Do dữ liệu từ Prometheus và Icinga2 phức tạp, AgileOps chọn triển khai thực tế (go-live) song song với điều chỉnh liên tục:
-
Thiết kế workflow incident chuyên biệt cho SVTECH, không dùng cấu hình mặc định
-
Cấu hình project service (dự án ITSM) trên JSM để phân loại cảnh báo qua nhiều tầng
-
Tích hợp sẵn các trường tùy chỉnh như Root Cause, Impact Area để phục vụ báo cáo sau sự cố
-
Tự động cập nhật trạng thái xử lý: Investigating (đang truy tìm), Identified (phát hiện), Resolved (hoàn thành)
Khi yêu cầu mới phát sinh trong quá trình go-live, anh Phụng - Senior Atlassian Consultant & Trainer và đội ngũ AgileOps đã kịp thời điều chỉnh.
Từ đó, đội kỹ sư SVTECH rút ngắn thời gian khắc phục sự cố (MTTR) và tiết kiệm nguồn lực.
Song song với thời điểm go-live, AgileOps tổ chức đào tạo cho nhóm vận hành, CNTT của SVTECH với các nội dung:
-
Hướng dẫn vận hành hệ thống giám sát tập trung trên JSM
-
Thiết lập và điều chỉnh các lệnh automation theo nhu cầu thực tế
-
Tự động hóa quy trình xử lý sự cố, từ tiếp nhận cảnh báo đến hoàn tất ticket
-
Tổng hợp báo cáo sau mỗi sự cố (post-incident review)
Để đảm bảo chất lượng quản trị hệ thống giám sát sự cố mới, AgileOps cung cấp tài liệu hướng dẫn chi tiết và tiếp tục hỗ trợ kỹ thuật sau nghiệm thu, đảm bảo team SVTech chủ động trong vận hành.