Datadog の Kubernetes モニタリング | Datadog

リアルタイムな Kubernetesのモニタリング

コンテナ化された環境全体のパフォーマンスの可視性を高め、問題を迅速に調査できます。

詳細はこちら
case-studies/resources_assetforce_casestudy

「取れる指標でなく、「人」を中心に通知を設計したことがDatadogの導入成功の鍵でしょう。適切な人に、次のアクションに繋がる情報を緊急度に応じた媒体で伝えることが重要です。通知が多すぎると、人は慣れて無視されて、肝心なときに役に立ちません。」

三井住友ファイナンス&リース株式会社

デジタル開発室 リードスペシャリスト 森本 悠太 氏


課題

三井住友ファイナンス&リースグループは、短期間でモニタリング環境を構築して、開発と運用を一体化し、システムの稼働を安定させる必要がありました。

Datadog による効果

三井住友ファイナンス&リースグループは、短期間でのモニタリング環境導入のため、シンプル、必要な機能を最初から使える、初期設定のまますぐに使えるダッシュボード、APIで細かくTwillioの通知フローを設定できる、機密性が高いログの除外に対応しているという 5つの理由からDatadogを選定しました。

case-studies/resources_ikyu_casestudy

「システムの健全性を把握するために必要な情報(メトリクスやログ)が散在していたため、異常発生時には複数のツールにまたがり原因を探す必要があり、職人技と運が必要でした。また、リリースのタイミングでパフォーマンスが落ちることがあり、クエリーやロジックをレビューするなど試行錯誤していました」

植竹 剛人 氏

CISO 兼データサイエンス部 部⻑ 兼CTO室 エンジニア

株式会社 一休


課題

メトリクスやログなどあちこちに情報があり、障害が起きたときにどこに問題があるのか職人技で探す必要があった。リリースのタイミングでパフォーマンスが落ち、サイトがタイム・アウトしてユーザーから見えないこともある。最優先の課題は、リアルタイムな統合モニタリングでエンドユーザーが気づく前に問題を解決可能になることでした。

Datadog による効果

システムのクラウド移行に伴い、SaaS型で運用負荷が少ない監視ツールを探したところ、Datadogが目についた。メトリクスが豊富で、ダッシュボードから必要な情報を一覧できて、Slackとの連携しやすいさなどが魅力だった。【問題対処を迅速化】プロダクト開発が責任をもって運用までおこなっている。インフラや外形監視でほぼリアルタイムで通知を受け、APMで問題解決とシームレスに対応ができるようになった。【デプロイが10倍以上に】2週間に1度だったデプロイをDatadog導入とともに自動化を進めた結果、1日数回へと大幅に頻度を上げられた。

case-studies/resources_nttdocomo_casestudy

「クラウドでの開発と運用を進めるなか、Datadogを導入した目的 は統合監視ツールで様々な事象を関連付けて分析することです。 可観測性が上がり、問題の切り分けから対応までが迅速化するだ けでなく、開発者はAPMでただちに性能試験もできて、ボトルネ ックをすぐ発見できる。我々はビジネスロジックに集中し、アジ リティを高めたい。そうした要件があるなかDatadogはSaaSで提 供されているので運用負荷が低く、マルチクラウドにも対応し ているところがよかった。」

株式会社NTTドコモ

サービスデザイン部 第三クラウド推進

担当部⻑ 三井 力 氏


課題

かつて現場では、開発と運用間のコミュニケーションに課題があった。トラブルの切り分けに時間が かかっていた。運用で問題が起きたらすぐに解 決したかった。

Datadog による効果

Datadogは様々な事象を関連付けて分析ができて、可観測性が高まり、対処までの時間を短縮できる。ダッシュボードの表現力、使い勝手、人気ランキングが表示されるなどの機能がメンバーを魅了し、有益なダッシュボードが次々と生まれた。DatadogがSaaS型で運用負荷が低く、マルチクラウド対応しているところもよかった。

customers/logos/softbank-black-back-v2

「Datadogを活用したDevOps基盤が構築できて、豊富なモニタリングとコスト最適化が実現できました。Datadogはマルチクラウドを意識することなく可視化できて、アプリとインフラ担当の共通言語となっています。今後はセキュリティ強化にも役立てていきたいと考えています」

ソフトバンク株式会社

コアネットワーク本部

クラウド基盤R&D統括部 クラウドネイティブ技術部

担当部⻑

山根 武信 氏


課題

ビジネスニーズの変化はめまぐるしく、開発現場は度重な る仕様変更に翻弄されていた。 そこで2018年、仕様変更に柔軟かつ素早く対応するため、アジャイル開発とDevOps環境構築に乗り出した。開発サイクルを加速させるためには、 DevOps環境における運用監視作業の省力化はもちろん、開発の様々な場面で可視化を実現する必要があった。

Datadog による効果

新たに構築したアジャイル開発 とDevOps基盤はクラウドのコン テナ Kubernetes環境なので、そ れまで使用していた監視ツール では不向きだった。コンテナに 対応した監視ツール各種で比較 したところ、Datadogは構築工 数やオンプレ連携、必要な機能 が揃い管理工数を低く抑えられ る統合ツールだったため採用。 開発から運用まで、あらゆる段 階で幅広く可視化できるのも大 きなメリットとなった。

多くの企業で愛用され信頼を得ています

Samsung logo Ubisoft logo Deloitte Cloud logo Cybozuinc logo sansan logo Nginx logo Chef logo Nasdaq logo DreamWorks Animation logo Nikon logo Zynga logo Evernote logo Sonos logo Monotaroco logo

製品のメリット

コンテナ化された環境を1画面でモニタリング

  • あらゆるクラウド環境に分散しているポッド、ネームスペース、ノードごとに、すべてのコンテナの健全性を分析
  • 1クリックでホットな状態で稼働している個々のコンテナへドリルダウンすることで、資源の競合や不足を回避
  • すべてのコンテナから粒度の高いメトリクスを自動的に収集、監視、可視化

大規模なK8環境の管理も安心

  • クラスタエージェントを使用して10,000以上のノードを低インパクトで監視可能
  • Datadog を HPA に接続し、リクエストレート、 レイテンシ、 使用可能なネットワーク帯域幅を収集することで、 水平方向の自動スケーリングを最適化
  • コンテナオーケストレーションを可視化し、リアルタイムのライブコンテナビューと自動生成されたコンテナマップを介して、Kubernetesポッドの利用可能なリソースの過不足を簡単に管理
  • 高粒度の履歴データを基に、運用コストの改善と余剰キャパシティの削減を実現

パフォーマンスの問題を迅速にトラブルシューティングし、ダウンタイムを最小化

  • 分散トレース、スタックトレース、完全なレイテンシブレークダウン、リクエストレベルの詳細を含むフレイムグラフにより、アプリケーションコードのパフォーマンスを完全に可視化
  • ダッシュボードレポート、合成テスト、App Analyticsを使用して、コンテナやサービスが高可用性を維持していることを簡単に確認
  • 時間同期化されたメトリックグラフに展開イベントを重ね合わせて、数秒で仮説をテスト

誤検出を排除し、重要な問題のみを対象にアラートを受信

  • サービスレベルのメトリクスに閾値と変更率のアラートを設定し、コンテナがスケールダウンしても混乱しないようにします。
  • 日次、週次、季節の変動を考慮したスマートなアラートを作成します。
  • システムレベルのメトリクスを予測することで、故障やエラーを積極的に防止します。
  • Watchdogを使用して、予期せぬ異常、異常、エラーを自動的に検出します。
_resized_landingpage_featureboxes_watchdog_20190115.png

Datadogで可視性を高める

  • Datadogの450以上の統合機能により、Dockerコンテナ、クラウドサービス、ロードバランサー、データベース、サーブレットを一か所で監視
  • カスタム・ダッシュボードをドラッグ・アンド・ドロップで数秒で作成し、粒度の高いメトリクスをリアルタイムで可視化
  • ログ、インフラストラクチャのメトリクス、アプリケーションのトレース間をシームレスにナビゲート
  • コンテナIDレベルのパフォーマンスデータを36時間自動的に保持
  • ヘルムチャートまたはデーモンセットを介して、クラスタ全体にエージェントを迅速にデプロイ
ProductVideoDashboard_HD.jpg

クラウド時代に不可欠なモニタリングとセキュリティのプラットフォーム

Datadogは、エンドツーエンドのトレース、メトリクス、ログを統合し、アプリケーション、インフラストラクチャ、サードパーティ・サービスを完全に可観測にします。

platform_diagram_lpg
platform_diagram_lpg

700+ 以上のすぐに使えるインテグレーション

なぜDatadogなのか?

すぐに使えるダッシュボード

セットアップ後すぐに、データがロードされ調査がはじまります


Watchdogによる異常の自動検出

Watchdogを利用することで設定や操作なしに、自動で環境の異常を発見します


700以上の統合機能

Datadogがサポートする統合機能で、任意のテクノロジーを幅広くカバーします。


各業界大手で実証済み

様々な業界のFortune 100の大企業が、Datadogを信頼しています