Runbook は手順書ではなく判断の入口である – アラート、ダッシュボード、ログを対応へつなぐ 作者: si62512548投稿日: 2026年7月22日カテゴリー: 監視タグ: Alertmanager, Grafana, Loki, Prometheus, Runbook, SRE, アラート, 監視, 監視設計, 運用設計, 障害対応Runbook は手順書ではなく判断の入口である – アラート、ダッシュボード、ログを対応へつなぐ へのコメントはまだありません Runbook は固定手順を並べるだけの文書ではなく、アラート通知を受けた人が影響範囲、原因候補、確認画面、ログ、エスカレーション条件へ進むための入口です。Prometheus、Alertmanager、Grafana、Loki と Runbook の関係を整理します。
Alertmanager の通知設計 – ルーティング、抑制、沈黙、責任分界を分ける 作者: si62512548投稿日: 2026年7月22日カテゴリー: 監視タグ: Alertmanager, Grafana, Prometheus, SLO, SRE, アラート, 監視, 監視設計, 運用設計Alertmanager の通知設計 – ルーティング、抑制、沈黙、責任分界を分ける へのコメントはまだありません Alertmanager はアラートを発火させる場所ではなく、通知の束ね方、宛先、抑制、沈黙、エスカレーションを設計する場所です。Prometheus の alert rule と Alertmanager の役割を分け、通知疲れを避けるための設計観点を整理します。
アラート閾値と自動実行条件を混同しない – 通知、抑制、停止、切り戻しの境界を分ける 作者: si62512548投稿日: 2026年7月17日カテゴリー: 設計・運用タグ: SRE, アラート, 切り戻し, 変更管理, 自動化, 運用設計アラート閾値と自動実行条件を混同しない – 通知、抑制、停止、切り戻しの境界を分ける へのコメントはまだありません アラート閾値、自動実行、通知抑制、停止条件、切り戻し条件、承認条件を分け、運用判断の境界として設計する考え方を整理します。
障害対応はどこで終わるのか – 復旧、安定化、恒久対応、再発防止を分ける 作者: si62512548投稿日: 2026年7月17日カテゴリー: 設計・運用タグ: SRE, インシデント管理, ポストモーテム, 再発防止, 運用設計, 障害対応障害対応はどこで終わるのか – 復旧、安定化、恒久対応、再発防止を分ける へのコメントはまだありません 障害対応を復旧、安定化、原因整理、恒久対応、再発防止、報告完了に分け、どこで終わったと判断するかを整理します。
リソース上限を倍率だけで考えない – CPU、メモリ、同時接続数、障害時の余白で見る 作者: si62512548投稿日: 2026年7月17日カテゴリー: 設計・運用タグ: CPU, SRE, キャパシティ管理, メモリ, リソース設計, 監視リソース上限を倍率だけで考えない – CPU、メモリ、同時接続数、障害時の余白で見る へのコメントはまだありません CPU、メモリ、同時接続数、キュー、障害時の余力を分け、リソース上限を単純な倍率ではなく影響範囲として設計する考え方を整理します。
SRE とは何か – SLI / SLO、エラーバジェット、トイルから理解する 作者: si62512548投稿日: 2026年6月29日カテゴリー: 設計・運用タグ: DevOps, Error Budget, IT 運用, SLI, SLO, SRE, Toil, システム設計, 監視設計, 運用設計SRE とは何か – SLI / SLO、エラーバジェット、トイルから理解する へのコメントはまだありません SRE とは、サービスの信頼性をソフトウェアエンジニアリングで扱う考え方です。SLI、SLO、エラーバジェット、トイル、DevOps や Platform Engineering との違いを解説します。