監視・運用
14件の記事
監視・運用 / 001 – 014 of 14
Notes & Insights
- プログラミング
GitOps入門|ArgoCD・FluxでGitをインフラの正とするデプロイ運用
GitOpsのPush型とPull型の違い、差分検知と自動同期の仕組み、リポジトリ構成、ArgoCDの最小導入手順までを解説。git revertで戻せるデプロイ運用が理解でき、Kubernetes以外への応用の考え方もわかります。
- プログラミング
Ansible入門|サーバー構成管理をPlaybookで自動化する基本と実践
手作業セットアップの限界と冪等性、Ansibleのエージェントレスな仕組み、インベントリ・Playbook・ロールの構造、Nginx+アプリ配置の最小Playbook、Terraformとの分担、ansible-vaultがわかります。
- プログラミング
502・503・504エラーの原因と切り分け|Webサーバー・アプリ・DBのどこで詰まっているか
502・503・504の意味と、CDN・ロードバランサー・Nginxのどの層が返しているかの見分け方、アプリ停止・ソケット不一致・タイムアウト・ワーカー枯渇・DB接続待ちといった典型原因、ログを見る順番と暫定対処・恒久対策までを解説します。
- プログラミング
災害復旧(DR)計画の立て方|RPO・RTOの決め方とバックアップ・リージョン戦略
RPO・RTOを事業側と合意する方法、バックアップ復元からマルチサイトまで4段階のDR構成とコストの関係、リージョン障害時のDNS切替と復旧手順書・定期訓練の進め方を解説。自社に合ったDR計画を作れるようになります。
- プログラミング
インシデント対応とポストモーテムの書き方|障害を再発させないための手順とテンプレート
検知から初動・影響範囲の特定・暫定対処・恒久対策までの流れ、指揮者と記録係の役割分担、社内外への連絡文例、非難しないポストモーテムのテンプレートと再発防止策の追跡方法まで、小さなチームで回せる障害対応の型を解説します。
- プログラミング
SLO・SLI・エラーバジェット入門|「どこまで落ちてよいか」を数値で決める運用設計
SLA・SLO・SLIの違いから、可用性とレイテンシのSLIの作り方、ユーザー視点でのSLOの決め方、エラーバジェットで開発と信頼性のバランスを取る方法、バーンレートアラートの設定、小さなチームでの始め方まで解説します。
- プログラミング
ヘルスチェック設計入門|Liveness・Readiness・依存先チェックで自動復旧を機能させる
ロードバランサーやKubernetesがヘルスチェックをどう使うかから、Liveness・Readinessの違い、DB依存を含める是非、Express/FastAPIの実装例、誤設定で全台ダウンする事故の防ぎ方まで解説します。
- プログラミング
サーバーのタイムゾーン・ロケール・文字コード設定|UTC運用と日本語環境の落とし穴
「サーバーはUTC・表示はJST」の原則、timedatectl、DBのtimestamptzの挙動、cronの実行時刻、LANGとUTF-8、文字化けの典型、コンテナのTZ、日付を跨ぐバグ事例を解説。時刻と文字の本番トラブルを防げます。
- プログラミング
サーバーの時刻同期(NTP・chrony)入門|時刻ずれが起こす障害と正しい設定
時刻ずれがTLS失敗・JWT期限切れ・ログ照合・分散DBの整合性にどう影響するかを整理し、NTPの階層構造、chronyの設定と確認コマンド、クラウド各社の時刻ソース、うるう秒とスミアリング、コンテナ内の時刻の扱いまで実務目線で解説します。
- プログラミング
ファイルディスクリプタとulimit|「Too many open files」の原因と根本対策
「Too many open files」の仕組みをファイルディスクリプタの概念から解説。ulimit・limits.conf・systemdのLimitNOFILEの違い、lsofでの調査、リークの典型パターンと根本対策がわかります。
- プログラミング
Linuxのメモリ管理入門|swap・OOM Killer・ページキャッシュの仕組みとメモリ不足の対処
freeのbuff/cacheとavailableの正しい読み方、swapとswappinessの役割、OOM Killerのログと選定ルール、コンテナのメモリ制限との関係を解説。「メモリ不足」を正しく診断し対処できるようになります。
- プログラミング
tcpdump・Wireshark入門|パケットキャプチャで通信トラブルの原因を特定する方法
tcpdumpのフィルタ構文とpcap保存、Wiresharkでの解析手順を実例で解説。「接続はできるが応答がない」「再送が多い」「DNSが失敗する」といった通信トラブルの原因を、ログではなくパケットから特定できるようになります。
- プログラミング
Nginxパフォーマンスチューニング|worker・keepalive・gzip/brotli・バッファ設定の実践
worker_processes/worker_connections、keepalive、gzip/brotli、sendfile、バッファ、open_file_cacheの各設定を根拠から解説し、変更前後の計測手順までわかります。
- 監視・運用
OpenTelemetry監視設定の完全ガイド|初心者でもわかる実践手順
OpenTelemetryの監視設定を初心者向けに解説。基本的な仕組みから実際の設定手順、トラブルシューティングまで、中小企業のIT担当者が実践できる内容をわかりやすくまとめました。分散システムの効果的な監視を始めましょう。