<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>CloudMonitoring on LIFELOG</title>
    <link>/tags/cloudmonitoring/</link>
    <description>Recent content in CloudMonitoring on LIFELOG</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>ja</language>
    <copyright>© 2026 0222-nnn</copyright>
    <lastBuildDate>Thu, 24 Sep 2026 00:00:00 +0900</lastBuildDate><atom:link href="/tags/cloudmonitoring/index.xml" rel="self" type="application/rss+xml" />
    
    <item>
      <title>Cloud Monitoring ダッシュボード実践｜既存ダッシュボードの活用からCustom Dashboard・Terraform管理まで</title>
      <link>/blog/20260924_terraform_gcp_advanced_cloud_monitoring_dashboard/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0900</pubDate>
      
      <guid>/blog/20260924_terraform_gcp_advanced_cloud_monitoring_dashboard/</guid>
      <description>&lt;h2 class=&#34;relative group&#34;&gt;概要 
    &lt;div id=&#34;概要&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a6%82%e8%a6%81&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;p&gt;障害の連絡を受けて Cloud Monitoring を開くと、ダッシュボードが何十も並んでいます。Google Cloud が自動で用意したもの、テンプレートから入れたもの、誰かが作ったもの。&lt;strong&gt;どれを開けばよいのか、足りないときに自分で作るべきなのかが分かりません。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;作ると決めても迷います。コンソールで作ったダッシュボードも JSON で取り出せます。ただ、作っただけでは Git などのソース管理に載りません。Terraform で管理しようとすると、今度はコンソールで触ってよいのかが分からなくなります。&lt;/p&gt;
&lt;p&gt;この記事では、次の順で進めます。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;Google Cloud が用意したダッシュボードとテンプレートで足りるかを見る&lt;/li&gt;
&lt;li&gt;足りない分を Custom Dashboard にまとめる&lt;/li&gt;
&lt;li&gt;フィルタと変数で、対象を切り替えられるようにする&lt;/li&gt;
&lt;li&gt;共有・権限・履歴など、運用に要るものを押さえる&lt;/li&gt;
&lt;li&gt;JSON を取り出し、gcloud と Terraform で管理する&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;ステップ2では、メトリクスに加えてログ・Incident・変更イベントも同じ画面に置きます。&lt;/p&gt;
&lt;p&gt;Metrics Explorer を開いたことがある人向けです。Terraform の基本操作（&lt;code&gt;init&lt;/code&gt; / &lt;code&gt;plan&lt;/code&gt; / &lt;code&gt;apply&lt;/code&gt;）は前提とします。&lt;/p&gt;
&lt;p&gt;扱わないものもあります。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;メトリクスの意味と集計の選び方。&lt;a href=&#34;/blog/2026_09_11_cloud_monitoring_metrics_reference/&#34;&gt;メトリクスの解説編&lt;/a&gt;に任せます&lt;/li&gt;
&lt;li&gt;アラートポリシー・通知チャネル・SLO の設計&lt;/li&gt;
&lt;li&gt;Cloud Logging のクエリの書き方。&lt;a href=&#34;/blog/2026_09_10_cloud_logging_query_reference/&#34;&gt;クエリ集&lt;/a&gt;に任せます&lt;/li&gt;
&lt;li&gt;サードパーティ製ダッシュボード、Grafana からの取り込み、Managed Service for Prometheus の構築&lt;/li&gt;
&lt;li&gt;すべてのウィジェットとサービスを網羅すること&lt;/li&gt;
&lt;/ul&gt;

&lt;h2 class=&#34;relative group&#34;&gt;検証環境 
    &lt;div id=&#34;検証環境&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a4%9c%e8%a8%bc%e7%92%b0%e5%a2%83&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Terraform v1.14.3、&lt;code&gt;hashicorp/google&lt;/code&gt; v7.46.1&lt;/li&gt;
&lt;li&gt;Google Cloud SDK 562.0.0、kubectl v1.35.2（GKE v1.35.8-gke.1036000）&lt;/li&gt;
&lt;li&gt;リージョン &lt;code&gt;asia-northeast1&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;サンプルコードは次にあります。&lt;/p&gt;</description>
      
    </item>
    
    <item>
      <title>Cloud Monitoring メトリクス チートシート｜障害調査でよく使うPromQLまとめ</title>
      <link>/blog/2026_09_24_cloud_monitoring_promql_cheatsheet/</link>
      <pubDate>Thu, 24 Sep 2026 00:00:00 +0900</pubDate>
      
      <guid>/blog/2026_09_24_cloud_monitoring_promql_cheatsheet/</guid>
      <description>&lt;h2 class=&#34;relative group&#34;&gt;このチートシートの使い方 
    &lt;div id=&#34;このチートシートの使い方&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e3%81%93%e3%81%ae%e3%83%81%e3%83%bc%e3%83%88%e3%82%b7%e3%83%bc%e3%83%88%e3%81%ae%e4%bd%bf%e3%81%84%e6%96%b9&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;p&gt;障害調査では「CPU が張り付いている VM はどれか」「5xx はいつから増えたか」といったクエリを何度も書きます。書くたびにメトリクス名とラベルを調べ直すと、そこで手が止まります。&lt;/p&gt;
&lt;p&gt;このページは、調べたいことから貼り付けられるクエリへすぐたどり着くための早見表です。&lt;strong&gt;急いでいるときは、&lt;a href=&#34;#by-purpose&#34;&gt;目的から探す&lt;/a&gt;へ直接進んでください。&lt;/strong&gt; そこから&lt;a href=&#34;#by-service&#34;&gt;サービスから探す&lt;/a&gt;のクエリへ飛べます。&lt;/p&gt;
&lt;p&gt;Metrics Explorer を開いたことがあり、クエリを素早く引きたい人向けです。Cloud Monitoring の入門とメトリクス収集の有効化は扱いません。アラートポリシー・SLO・ダッシュボードの設計も範囲外です。&lt;/p&gt;
&lt;p&gt;集計やラベルの仕組みは&lt;a href=&#34;/blog/2026_09_11_cloud_monitoring_metrics_reference/&#34;&gt;解説編&lt;/a&gt;に、メトリクスが取れるかどうかの調べ方は&lt;a href=&#34;/blog/2026_09_19_cloud_monitoring_metric_availability/&#34;&gt;確認編&lt;/a&gt;にあります。ここでは繰り返しません。&lt;/p&gt;

&lt;h3 class=&#34;relative group&#34;&gt;クエリを入力する場所 
    &lt;div id=&#34;where-to-enter&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#where-to-enter&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h3&gt;
&lt;p&gt;PromQL も Monitoring filter も Metrics Explorer に入力します。ただし入口が違います（&lt;a href=&#34;https://docs.cloud.google.com/monitoring/charts/metrics-selector&#34; target=&#34;_blank&#34;&gt;Metrics Explorer の資料&lt;/a&gt;）。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;種類&lt;/th&gt;
          &lt;th&gt;入力する場所&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;PromQL&lt;/td&gt;
          &lt;td&gt;クエリペインのツールバーで &lt;strong&gt;PromQL&lt;/strong&gt; ボタンを選び、エディタに貼る&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Monitoring filter&lt;/td&gt;
          &lt;td&gt;Metric 要素の &lt;strong&gt;Help&lt;/strong&gt; から &lt;strong&gt;Direct Filter Mode&lt;/strong&gt; を選び、Filters の欄に貼る&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;見出しに「（Monitoring filter）」と付いたクエリ以外は、すべて PromQL です。&lt;/strong&gt; 入力欄を切り替えると、入力中のクエリは破棄されます。&lt;/p&gt;</description>
      
    </item>
    
    <item>
      <title>Cloud Monitoringで取れるか調べる手順（定義はあるのに時系列は0件だった）</title>
      <link>/blog/2026_09_19_cloud_monitoring_metric_availability/</link>
      <pubDate>Sat, 19 Sep 2026 00:00:00 +0900</pubDate>
      
      <guid>/blog/2026_09_19_cloud_monitoring_metric_availability/</guid>
      <description>&lt;h2 class=&#34;relative group&#34;&gt;概要 
    &lt;div id=&#34;概要&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a6%82%e8%a6%81&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;p&gt;監視項目を決めるとき、最初に詰まるのは名前ではありません。&lt;strong&gt;「そもそも取れるのか」が分からない&lt;/strong&gt;ことです。&lt;/p&gt;
&lt;p&gt;メモリ使用率が見つからない。GKEのAPIサーバの指標が無い。Metrics Explorerを開いてもグラフが出ない。&lt;/p&gt;
&lt;p&gt;原因が、収集していないのか、名前が違うのか、そもそも存在しないのか、画面からは区別がつきません。&lt;/p&gt;
&lt;p&gt;この記事で扱うのは&lt;strong&gt;調べ方&lt;/strong&gt;です。どの一覧を開き、何を読み、見つからなかったら次に何をするか。&lt;/p&gt;
&lt;p&gt;メトリクスの一覧そのものは載せません。一覧はGoogle側で増減するので、写した記事はすぐ古くなります。&lt;/p&gt;
&lt;p&gt;対になる記事があります。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;記事&lt;/th&gt;
          &lt;th&gt;役割&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;この記事&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;調べ方。&lt;/strong&gt; 取れるかどうかを自分で判定する&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;a href=&#34;/blog/2026_09_11_cloud_monitoring_metrics_reference/&#34;&gt;よく使うCloud Monitoringメトリクスまとめ&lt;/a&gt;&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;具体例。&lt;/strong&gt; GCE・GKE・Cloud Run・LBなどの実測値つき早見表と、集計・ラベル・取り方&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;&lt;a href=&#34;/blog/2026_09_24_cloud_monitoring_promql_cheatsheet/&#34;&gt;Cloud Monitoring メトリクス チートシート&lt;/a&gt;&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;クエリ集。&lt;/strong&gt; 障害調査で使う PromQL と Monitoring filter を、目的とサービスから引く&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;Google Cloudのメトリクスを一度は触ったことがある人向けです。集計やPromQLの書き方、アラートポリシーの設計は扱いません。ログについては&lt;a href=&#34;/blog/2026_09_10_cloud_logging_query_reference/&#34;&gt;クエリ集の記事&lt;/a&gt;があります。&lt;/p&gt;

&lt;h2 class=&#34;relative group&#34;&gt;検証環境 
    &lt;div id=&#34;検証環境&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a4%9c%e8%a8%bc%e7%92%b0%e5%a2%83&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Google Cloud SDK 562.0.0、Monitoring API v3&lt;/li&gt;
&lt;li&gt;公式ドキュメントの確認日は2026年9月19日&lt;/li&gt;
&lt;li&gt;APIの実行は2026年9月19日、&lt;code&gt;asia-northeast1&lt;/code&gt; のリソースを対象&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;この記事の断定には2種類あります。公式ドキュメントを根拠にしたものと、実際にAPIを呼び出して確かめたものです。混ざらないように、実測した箇所には出力を載せています。&lt;/p&gt;</description>
      
    </item>
    
    <item>
      <title>Cookieに backend-a と書いても backend-a2 へ届く。ALBのセッションアフィニティを実測した</title>
      <link>/blog/20260913_terraform_gcp_advanced_regional_alb_session_affinity/</link>
      <pubDate>Sun, 13 Sep 2026 00:00:00 +0900</pubDate>
      
      <guid>/blog/20260913_terraform_gcp_advanced_regional_alb_session_affinity/</guid>
      <description>&lt;h2 class=&#34;relative group&#34;&gt;概要 
    &lt;div id=&#34;概要&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a6%82%e8%a6%81&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;p&gt;ログイン状態をサーバ側のメモリに置いている。ロードバランサが毎回違うバックエンドへ振ると、数リクエストごとにログアウトする。同じクライアントを同じバックエンドへ送りたい。&lt;/p&gt;
&lt;p&gt;Google Cloud のロードバランサには &lt;code&gt;session_affinity&lt;/code&gt; があります。リージョン外部ALBで選べるのは&lt;a href=&#34;https://docs.cloud.google.com/load-balancing/docs/https/request-distribution&#34; target=&#34;_blank&#34;&gt;6種類&lt;/a&gt;です。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;NONE / CLIENT_IP / GENERATED_COOKIE / HEADER_FIELD / HTTP_COOKIE / STRONG_COOKIE_AFFINITY
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;この記事で比べるのは Cookie を使う2つです。違いは「誰が発行するか」ではありません。&lt;/p&gt;
&lt;p&gt;&lt;code&gt;GENERATED_COOKIE&lt;/code&gt; はLBが発行した Cookie を使います。一方 &lt;code&gt;HTTP_COOKIE&lt;/code&gt; が使うのは、&lt;strong&gt;名前を指定した Cookie の値&lt;/strong&gt;です。その名前の Cookie が無ければLBが生成します。&lt;/p&gt;
&lt;p&gt;後者を使うとき、こう書きたくなります。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;bp&#34;&gt;self&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;.&lt;/span&gt;&lt;span class=&#34;n&#34;&gt;send_header&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;s2&#34;&gt;&amp;#34;Set-Cookie&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;ROUTE=backend-a; Path=/&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;)&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;&lt;strong&gt;これはバックエンドの指定になりません。&lt;/strong&gt; 固定はされますが、&lt;code&gt;backend-a&lt;/code&gt; という綴りがバックエンド &lt;code&gt;backend-a&lt;/code&gt; を指すわけではありません。実測では、&lt;code&gt;ROUTE=backend-a&lt;/code&gt; を送ったリクエストが10回とも &lt;strong&gt;&lt;code&gt;backend-a2&lt;/code&gt;&lt;/strong&gt; に届きました。&lt;/p&gt;
&lt;p&gt;あわせて、固定が外れる条件と、効いていることをどこで確かめられるかも測ります。後者は予想と違いました。&lt;/p&gt;
&lt;p&gt;Google Cloud のロードバランサを触ったことがある人向けです。構成の作り方は&lt;a href=&#34;/blog/20260911_terraform_gcp_advanced_regional_alb_proxy_subnet/&#34;&gt;リージョンALBの回&lt;/a&gt;で扱っており、ここではアフィニティの差分だけを見ます。gRPC やステートフルなセッション管理の設計は扱いません。&lt;/p&gt;

&lt;h2 class=&#34;relative group&#34;&gt;検証環境 
    &lt;div id=&#34;検証環境&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a4%9c%e8%a8%bc%e7%92%b0%e5%a2%83&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Terraform v1.14.3、&lt;code&gt;hashicorp/google&lt;/code&gt; v7.44.0&lt;/li&gt;
&lt;li&gt;Google Cloud SDK 562.0.0、curl 7.81.0&lt;/li&gt;
&lt;li&gt;初回検証は2026年9月13日、再検証は2026年9月19日、いずれも &lt;code&gt;asia-northeast1&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;初回・再検証は別デプロイです。&lt;code&gt;AFFLOG&lt;/code&gt; の Cookie 関連の記録（6件のログなど）は9月13日、&lt;code&gt;request_count&lt;/code&gt;・&lt;code&gt;backend_request_count&lt;/code&gt; の94件／30件を含む指標系の集計は9月19日の再検証結果です。断りのない数値は、それぞれの取得時点のデプロイでの集計としてください。Cookie の対応だけは、作り直す前と後の2回ぶんを並べています。&lt;/p&gt;</description>
      
    </item>
    
    <item>
      <title>よく使うCloud Monitoringメトリクスまとめ（集計を変えたら同じCPU使用率が3倍になった）</title>
      <link>/blog/2026_09_11_cloud_monitoring_metrics_reference/</link>
      <pubDate>Fri, 11 Sep 2026 00:00:00 +0900</pubDate>
      
      <guid>/blog/2026_09_11_cloud_monitoring_metrics_reference/</guid>
      <description>&lt;h2 class=&#34;relative group&#34;&gt;概要 
    &lt;div id=&#34;概要&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a6%82%e8%a6%81&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;p&gt;Metrics Explorerは、メトリクス名さえ分かれば絞り込めます。厄介なのは&lt;strong&gt;その先&lt;/strong&gt;です。同じメトリクス・同じ期間でも、集計の選び方で値が変わります。&lt;/p&gt;
&lt;p&gt;実際にこうなりました。&lt;/p&gt;
&lt;p&gt;同じVM、同じ1時間の枠での CPU 使用率です。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;集計&lt;/th&gt;
          &lt;th&gt;値&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;1時間平均（&lt;code&gt;ALIGN_MEAN&lt;/code&gt;）&lt;/td&gt;
          &lt;td&gt;0.14&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;1時間最大（&lt;code&gt;ALIGN_MAX&lt;/code&gt;）&lt;/td&gt;
          &lt;td&gt;0.4251&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;3倍です。&lt;/strong&gt; どちらも正しく、見たいものが違うだけです。ここを意識しないまま閾値を決めると、鳴らないアラートか鳴りっぱなしのアラートになり、あとから原因が追えなくて困ります。&lt;/p&gt;
&lt;p&gt;自分が検証で実際に取ったメトリクスと値を、まとめて置いておきます。&lt;a href=&#34;/blog/2026_09_10_cloud_logging_query_reference/&#34;&gt;Cloud Loggingのクエリ集&lt;/a&gt;と対になるリファレンスです。貼り付けて使うクエリは、&lt;a href=&#34;/blog/2026_09_24_cloud_monitoring_promql_cheatsheet/&#34;&gt;Cloud Monitoring メトリクス チートシート&lt;/a&gt;に目的別・サービス別でまとめています。&lt;/p&gt;
&lt;p&gt;Google Cloudのコンソールを触ったことがある人向けです。監視の設計論やSLOの立て方は扱いません。&lt;/p&gt;

&lt;h2 class=&#34;relative group&#34;&gt;検証環境 
    &lt;div id=&#34;検証環境&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a4%9c%e8%a8%bc%e7%92%b0%e5%a2%83&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Google Cloud SDK 562.0.0&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;値は、このブログのTerraform/Google Cloudシリーズで作った検証環境から実際に取得したものです。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;リソースは削除済みですが、メトリクスは残っています。&lt;/strong&gt; ログと同じで、片付けたあとでも調べ直せます。&lt;/p&gt;
&lt;p&gt;ただし解像度は下がります。&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;種別&lt;/th&gt;
          &lt;th&gt;保持&lt;/th&gt;
          &lt;th&gt;解像度&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;Compute Engine・GKE・Cloud SQL など、&lt;a href=&#34;https://docs.cloud.google.com/monitoring/quotas&#34; target=&#34;_blank&#34;&gt;公式表&lt;/a&gt;が挙げる指標&lt;/td&gt;
          &lt;td&gt;24か月&lt;/td&gt;
          &lt;td&gt;6週間は元の頻度、以降は10分間隔&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;カスタム・外部・エージェント&lt;/td&gt;
          &lt;td&gt;24か月&lt;/td&gt;
          &lt;td&gt;同上&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Managed Service for Prometheus・OTLP&lt;/td&gt;
          &lt;td&gt;24か月&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;1週間は元の頻度、次の5週間は1分間隔&lt;/strong&gt;、以降は10分間隔&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;それ以外&lt;/td&gt;
          &lt;td&gt;6週間&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;6週間を過ぎた分は&lt;a href=&#34;https://docs.cloud.google.com/monitoring/quotas#data_retention&#34; target=&#34;_blank&#34;&gt;10分間隔にダウンサンプリングされます&lt;/a&gt;。細かい変化を見たい検証結果は、その場で保存しておきます。&lt;/p&gt;</description>
      
    </item>
    
    <item>
      <title>GKEでPodの退避を起こしたら、監視に必要なメトリクスがCloud Monitoringに来なかった</title>
      <link>/blog/20260906_terraform_gcp_advanced_gke_pod_eviction/</link>
      <pubDate>Sun, 06 Sep 2026 00:00:01 +0900</pubDate>
      
      <guid>/blog/20260906_terraform_gcp_advanced_gke_pod_eviction/</guid>
      <description>&lt;h2 class=&#34;relative group&#34;&gt;概要 
    &lt;div id=&#34;概要&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%a6%82%e8%a6%81&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;p&gt;ノードのメモリやディスクが逼迫すると、kubelet が Pod を退避（Eviction）します。退避された Pod は &lt;code&gt;Failed&lt;/code&gt; として API 上に残り、PodGC が片付けるまで一覧に並び続けます。&lt;/p&gt;
&lt;p&gt;監視していなければ、原因の分からない &lt;code&gt;Failed&lt;/code&gt; Pod が増えていくだけです。&lt;/p&gt;
&lt;p&gt;そこで退避を監視しようとして、最初につまずきました。&lt;code&gt;kube_pod_status_reason{reason=&amp;quot;Evicted&amp;quot;}&lt;/code&gt; を Cloud Monitoring で引いても、何も返ってきません。&lt;/p&gt;
&lt;p&gt;これは kube-state-metrics が出すメトリクスで、Pod の &lt;code&gt;status.reason&lt;/code&gt; をそのままラベルにしたものです。退避された Pod には &lt;code&gt;reason=&amp;quot;Evicted&amp;quot;&lt;/code&gt; のラベルが付きます。&lt;/p&gt;
&lt;p&gt;Gauge なので、&lt;code&gt;sum()&lt;/code&gt; で分かるのは&lt;strong&gt;現在 API 上に残っている &lt;code&gt;Evicted&lt;/code&gt; の Pod 数&lt;/strong&gt;です。累積の退避回数ではありませんが、退避を検知するアラートなら、まず候補に挙がります。&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-promql&#34; data-lang=&#34;promql&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;k&#34;&gt;sum&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;(&lt;/span&gt;&lt;span class=&#34;nv&#34;&gt;kube_pod_status_reason&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;{&lt;/span&gt;&lt;span class=&#34;nl&#34;&gt;reason&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;=&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;&amp;#34;&lt;/span&gt;&lt;span class=&#34;s&#34;&gt;Evicted&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;&amp;#34;}&lt;/span&gt;&lt;span class=&#34;o&#34;&gt;)&lt;/span&gt;&lt;span class=&#34;w&#34;&gt; &lt;/span&gt;&lt;span class=&#34;o&#34;&gt;&amp;gt;&lt;/span&gt;&lt;span class=&#34;w&#34;&gt; &lt;/span&gt;&lt;span class=&#34;mi&#34;&gt;0&lt;/span&gt;&lt;span class=&#34;w&#34;&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;収集そのものは動いていました。Managed Service for Prometheus（GMP）は有効で、&lt;code&gt;up{job=&amp;quot;kube-state-metrics&amp;quot;}&lt;/code&gt; は 1 を返します。それでも、退避を数えるためのメトリクスだけが Cloud Monitoring に入っていません。&lt;/p&gt;
&lt;p&gt;この状態でどこを見れば退避に気づけるのか。GKE で実際に退避を起こして確かめました。&lt;/p&gt;

&lt;h2 class=&#34;relative group&#34;&gt;対象読者 
    &lt;div id=&#34;対象読者&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e5%af%be%e8%b1%a1%e8%aa%ad%e8%80%85&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;GKE でワークロードを動かしたことがある&lt;/li&gt;
&lt;li&gt;&lt;code&gt;kubectl describe&lt;/code&gt; で Pod の状態を読める&lt;/li&gt;
&lt;/ul&gt;

&lt;h2 class=&#34;relative group&#34;&gt;扱わないもの 
    &lt;div id=&#34;扱わないもの&#34; class=&#34;anchor&#34;&gt;&lt;/div&gt;
    
    &lt;span
        class=&#34;absolute top-0 w-6 transition-opacity opacity-0 ltr:-left-6 rtl:-right-6 not-prose group-hover:opacity-100&#34;&gt;
        &lt;a class=&#34;group-hover:text-primary-300 dark:group-hover:text-neutral-700&#34;
            style=&#34;text-decoration-line: none !important;&#34; href=&#34;#%e6%89%b1%e3%82%8f%e3%81%aa%e3%81%84%e3%82%82%e3%81%ae&#34; aria-label=&#34;アンカー&#34;&gt;#&lt;/a&gt;
    &lt;/span&gt;        
    
&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Kubernetes と GKE の入門&lt;/li&gt;
&lt;li&gt;Pod Disruption Budget、&lt;code&gt;kubectl drain&lt;/code&gt; による退去（今回はノード逼迫による退避）&lt;/li&gt;
&lt;li&gt;HorizontalPodAutoscaler、Cluster Autoscaler&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;退避が起きたときに、何をどこで観測できるかに絞ります。&lt;/p&gt;</description>
      
    </item>
    
  </channel>
</rss>
