前言

本文介绍在k8s集群中使用node-exporter、prometheus、grafana对集群进行监控。
其实现原理有点类似ELK、EFK组合。node-exporter组件负责收集节点上的metrics监控数据,并将数据推送给prometheus, prometheus负责存储这些数据,grafana将这些数据通过网页以图形的形式展现给用户。

在开始之前有必要了解下Prometheus是什么?
Prometheus (中文名:普罗米修斯)是由 SoundCloud 开发的开源监控报警系统和时序列数据库(TSDB).自2012年起,许多公司及组织已经采用 Prometheus,并且该项目有着非常活跃的开发者和用户社区.现在已经成为一个独立的开源项目。Prometheus 在2016加入 CNCF ( Cloud Native Computing Foundation ), 作为在 kubernetes 之后的第二个由基金会主持的项目。 Prometheus 的实现参考了Google内部的监控实现,与源自Google的Kubernetes结合起来非常合适。另外相比influxdb的方案,性能更加突出,而且还内置了报警功能。它针对大规模的集群环境设计了拉取式的数据采集方式,只需要在应用里面实现一个metrics接口,然后把这个接口告诉Prometheus就可以完成数据采集了,下图为prometheus的架构图。

Prometheus的特点:
1、多维数据模型(时序列数据由metric名和一组key/value组成)
2、在多维度上灵活的查询语言(PromQl)
3、不依赖分布式存储,单主节点工作.
4、通过基于HTTP的pull方式采集时序数据
5、可以通过中间网关进行时序列数据推送(pushing)
6、目标服务器可以通过发现服务或者静态配置实现
7、多种可视化和仪表盘支持

prometheus 相关组件,Prometheus生态系统由多个组件组成,其中许多是可选的:
1、Prometheus 主服务,用来抓取和存储时序数据
2、client library 用来构造应用或 exporter 代码 (go,java,python,ruby)
3、push 网关可用来支持短连接任务
4、可视化的dashboard (两种选择,promdash 和 grafana.目前主流选择是 grafana.)
4、一些特殊需求的数据出口(用于HAProxy, StatsD, Graphite等服务)
5、实验性的报警管理端(alartmanager,单独进行报警汇总,分发,屏蔽等 )

promethues 的各个组件基本都是用 golang 编写,对编译和部署十分友好.并且没有特殊依赖.基本都是独立工作。

部署

现在我们正式开始部署工作。这里假设你已经为你的K8S集群部署过kube-dns或者coredns了。
一、环境介绍
操作系统环境:centos linux 7.5 64bit
K8S软件版本: 1.12.3
Master节点IP: 10.40.0.151/24

Node01节点IP: 10.40.0.152/24

Node02节点IP: 10.40.0.153/24

二、采用daemonset方式部署node-exporter组件

  1. cat node-exporter.yaml
  2.  
  3. apiVersion: extensions/v1beta1
  4. kind: DaemonSet
  5. metadata:
  6. name: node-exporter
  7. namespace: kube-system
  8. labels:
  9. k8s-app: node-exporter
  10. spec:
  11. template:
  12. metadata:
  13. labels:
  14. k8s-app: node-exporter
  15. spec:
  16. containers:
  17. - image: prom/node-exporter
  18. name: node-exporter
  19. ports:
  20. - containerPort:
  21. protocol: TCP
  22. name: http
  23. ---
  24. apiVersion: v1
  25. kind: Service
  26. metadata:
  27. labels:
  28. k8s-app: node-exporter
  29. name: node-exporter
  30. namespace: kube-system
  31. spec:
  32. ports:
  33. - name: http
  34. port:
  35. nodePort:
  36. protocol: TCP
  37. type: NodePort
  38. selector:
  39. k8s-app: node-exporter

三、部署prometheus组件

1、rbac文件

  1. cat rbac-setup.yaml
  2.  
  3. apiVersion: rbac.authorization.k8s.io/v1
  4. kind: ClusterRole
  5. metadata:
  6. name: prometheus
  7. rules:
  8. - apiGroups: [""]
  9. resources:
  10. - nodes
  11. - nodes/proxy
  12. - services
  13. - endpoints
  14. - pods
  15. verbs: ["get", "list", "watch"]
  16. - apiGroups:
  17. - extensions
  18. resources:
  19. - ingresses
  20. verbs: ["get", "list", "watch"]
  21. - nonResourceURLs: ["/metrics"]
  22. verbs: ["get"]
  23. ---
  24. apiVersion: v1
  25. kind: ServiceAccount
  26. metadata:
  27. name: prometheus
  28. namespace: kube-system
  29. ---
  30. apiVersion: rbac.authorization.k8s.io/v1
  31. kind: ClusterRoleBinding
  32. metadata:
  33. name: prometheus
  34. roleRef:
  35. apiGroup: rbac.authorization.k8s.io
  36. kind: ClusterRole
  37. name: prometheus
  38. subjects:
  39. - kind: ServiceAccount
  40. name: prometheus
  41. namespace: kube-system

2、以configmap的形式管理prometheus组件的配置文件

  1. cat configmap.yaml
  2.  
  3. apiVersion: v1
  4. kind: ConfigMap
  5. metadata:
  6. name: prometheus-config
  7. namespace: kube-system
  8. data:
  9. prometheus.yml: |
  10. global:
  11. scrape_interval: 15s
  12. evaluation_interval: 15s
  13. scrape_configs:
  14.  
  15. - job_name: 'kubernetes-apiservers'
  16. kubernetes_sd_configs:
  17. - role: endpoints
  18. scheme: https
  19. tls_config:
  20. ca_file: /var/run/secrets/kubernetes.io/serviceaccount/ca.crt
  21. bearer_token_file: /var/run/secrets/kubernetes.io/serviceaccount/token
  22. relabel_configs:
  23. - source_labels: [__meta_kubernetes_namespace, __meta_kubernetes_service_name, __meta_kubernetes_endpoint_port_name]
  24. action: keep
  25. regex: default;kubernetes;https
  26.  
  27. - job_name: 'kubernetes-nodes'
  28. kubernetes_sd_configs:
  29. - role: node
  30. scheme: https
  31. tls_config:
  32. ca_file: /var/run/secrets/kubernetes.io/serviceaccount/ca.crt
  33. bearer_token_file: /var/run/secrets/kubernetes.io/serviceaccount/token
  34. relabel_configs:
  35. - action: labelmap
  36. regex: __meta_kubernetes_node_label_(.+)
  37. - target_label: __address__
  38. replacement: kubernetes.default.svc:
  39. - source_labels: [__meta_kubernetes_node_name]
  40. regex: (.+)
  41. target_label: __metrics_path__
  42. replacement: /api/v1/nodes/${}/proxy/metrics
  43.  
  44. - job_name: 'kubernetes-cadvisor'
  45. kubernetes_sd_configs:
  46. - role: node
  47. scheme: https
  48. tls_config:
  49. ca_file: /var/run/secrets/kubernetes.io/serviceaccount/ca.crt
  50. bearer_token_file: /var/run/secrets/kubernetes.io/serviceaccount/token
  51. relabel_configs:
  52. - action: labelmap
  53. regex: __meta_kubernetes_node_label_(.+)
  54. - target_label: __address__
  55. replacement: kubernetes.default.svc:
  56. - source_labels: [__meta_kubernetes_node_name]
  57. regex: (.+)
  58. target_label: __metrics_path__
  59. replacement: /api/v1/nodes/${}/proxy/metrics/cadvisor
  60.  
  61. - job_name: 'kubernetes-service-endpoints'
  62. kubernetes_sd_configs:
  63. - role: endpoints
  64. relabel_configs:
  65. - source_labels: [__meta_kubernetes_service_annotation_prometheus_io_scrape]
  66. action: keep
  67. regex: true
  68. - source_labels: [__meta_kubernetes_service_annotation_prometheus_io_scheme]
  69. action: replace
  70. target_label: __scheme__
  71. regex: (https?)
  72. - source_labels: [__meta_kubernetes_service_annotation_prometheus_io_path]
  73. action: replace
  74. target_label: __metrics_path__
  75. regex: (.+)
  76. - source_labels: [__address__, __meta_kubernetes_service_annotation_prometheus_io_port]
  77. action: replace
  78. target_label: __address__
  79. regex: ([^:]+)(?::\d+)?;(\d+)
  80. replacement: $:$
  81. - action: labelmap
  82. regex: __meta_kubernetes_service_label_(.+)
  83. - source_labels: [__meta_kubernetes_namespace]
  84. action: replace
  85. target_label: kubernetes_namespace
  86. - source_labels: [__meta_kubernetes_service_name]
  87. action: replace
  88. target_label: kubernetes_name
  89.  
  90. - job_name: 'kubernetes-services'
  91. kubernetes_sd_configs:
  92. - role: service
  93. metrics_path: /probe
  94. params:
  95. module: [http_2xx]
  96. relabel_configs:
  97. - source_labels: [__meta_kubernetes_service_annotation_prometheus_io_probe]
  98. action: keep
  99. regex: true
  100. - source_labels: [__address__]
  101. target_label: __param_target
  102. - target_label: __address__
  103. replacement: blackbox-exporter.example.com:
  104. - source_labels: [__param_target]
  105. target_label: instance
  106. - action: labelmap
  107. regex: __meta_kubernetes_service_label_(.+)
  108. - source_labels: [__meta_kubernetes_namespace]
  109. target_label: kubernetes_namespace
  110. - source_labels: [__meta_kubernetes_service_name]
  111. target_label: kubernetes_name
  112.  
  113. - job_name: 'kubernetes-ingresses'
  114. kubernetes_sd_configs:
  115. - role: ingress
  116. relabel_configs:
  117. - source_labels: [__meta_kubernetes_ingress_annotation_prometheus_io_probe]
  118. action: keep
  119. regex: true
  120. - source_labels: [__meta_kubernetes_ingress_scheme,__address__,__meta_kubernetes_ingress_path]
  121. regex: (.+);(.+);(.+)
  122. replacement: ${}://${2}${3}
  123. target_label: __param_target
  124. - target_label: __address__
  125. replacement: blackbox-exporter.example.com:
  126. - source_labels: [__param_target]
  127. target_label: instance
  128. - action: labelmap
  129. regex: __meta_kubernetes_ingress_label_(.+)
  130. - source_labels: [__meta_kubernetes_namespace]
  131. target_label: kubernetes_namespace
  132. - source_labels: [__meta_kubernetes_ingress_name]
  133. target_label: kubernetes_name
  134.  
  135. - job_name: 'kubernetes-pods'
  136. kubernetes_sd_configs:
  137. - role: pod
  138. relabel_configs:
  139. - source_labels: [__meta_kubernetes_pod_annotation_prometheus_io_scrape]
  140. action: keep
  141. regex: true
  142. - source_labels: [__meta_kubernetes_pod_annotation_prometheus_io_path]
  143. action: replace
  144. target_label: __metrics_path__
  145. regex: (.+)
  146. - source_labels: [__address__, __meta_kubernetes_pod_annotation_prometheus_io_port]
  147. action: replace
  148. regex: ([^:]+)(?::\d+)?;(\d+)
  149. replacement: $:$
  150. target_label: __address__
  151. - action: labelmap
  152. regex: __meta_kubernetes_pod_label_(.+)
  153. - source_labels: [__meta_kubernetes_namespace]
  154. action: replace
  155. target_label: kubernetes_namespace
  156. - source_labels: [__meta_kubernetes_pod_name]
  157. action: replace
  158. target_label: kubernetes_pod_name

3、Prometheus deployment 文件

  1. cat prometheus.yaml
  2.  
  3. apiVersion: apps/v1beta2
  4. kind: Deployment
  5. metadata:
  6. labels:
  7. name: prometheus-deployment
  8. name: prometheus
  9. namespace: kube-system
  10. spec:
  11. replicas:
  12. selector:
  13. matchLabels:
  14. app: prometheus
  15. template:
  16. metadata:
  17. labels:
  18. app: prometheus
  19. spec:
  20. containers:
  21. - image: prom/prometheus:v2.0.0
  22. name: prometheus
  23. command:
  24. - "/bin/prometheus"
  25. args:
  26. - "--config.file=/etc/prometheus/prometheus.yml"
  27. - "--storage.tsdb.path=/prometheus"
  28. - "--storage.tsdb.retention=24h"
  29. ports:
  30. - containerPort:
  31. protocol: TCP
  32. volumeMounts:
  33. - mountPath: "/prometheus"
  34. name: data
  35. - mountPath: "/etc/prometheus"
  36. name: config-volume
  37. resources:
  38. requests:
  39. cpu: 100m
  40. memory: 100Mi
  41. limits:
  42. cpu: 500m
  43. memory: 2500Mi
  44. serviceAccountName: prometheus
  45. volumes:
  46. - name: data
  47. emptyDir: {}
  48. - name: config-volume
  49. configMap:
  50. name: prometheus-config
  51. ---
  52. kind: Service
  53. apiVersion: v1
  54. metadata:
  55. labels:
  56. app: prometheus
  57. name: prometheus
  58. namespace: kube-system
  59. spec:
  60. type: NodePort
  61. ports:
  62. - port:
  63. targetPort:
  64. nodePort:
  65. selector:
  66. app: prometheus

4、通过上述yaml文件创建相应的对象

  1. kubectl create -f node-exporter.yaml
  2. kubectl create -f rbac-setup.yaml
  3. kubectl create -f configmap.yaml
  4. kubectl create -f promethues.yaml

5、查看相关pod和service

  1. # kubectl get pods -n kube-system
  2. NAME READY STATUS RESTARTS AGE
  3. coredns-779dfc4d59-rtpmk / Running 48s
  4. kubernetes-dashboard-b54f75c69-tnn4h / Running 90m
  5. node-exporter-sflqg / Running 9m44s
  6. node-exporter-xfsf8 / Running 9m44s
  7. prometheus-58dc44f44c-z86rv / Running 8m44s
  1. # kubectl get svc -n kube-system
  2. NAME TYPE CLUSTER-IP EXTERNAL-IP PORT(S) AGE
  3. kube-dns ClusterIP 10.250.0.2 <none> /UDP,/TCP 117s
  4. kubernetes-dashboard NodePort 10.250.1.89 <none> :/TCP 102m
  5. node-exporter NodePort 10.250.0.165 <none> :/TCP 10m
  6. prometheus NodePort 10.250.0.53 <none> :/TCP 9m53s

6、Node-exporter对应的nodeport端口为31672,通过访问http://10.40.0.152:31672/metrics 可以看到对应的metrics

7、prometheus对应的nodeport端口为30003,通过访问http://10.40.0.152:30003/targets 可以看到prometheus已经成功连接上了k8s的apiserver

8、在prometheus的WEB界面上提供了基本的查询K8S集群中每个POD的CPU使用情况,可以使用如下查询条件查询:

  1. sum by (pod_name)( rate(container_cpu_usage_seconds_total{image!="", pod_name!=""}[1m] ) )

上述的查询有出现数据,说明node-exporter往prometheus中写入数据正常,接下来我们就可以部署grafana组件,实现更友好的webui展示数据了。

五、部署grafana组件
1、grafana deployment配置文件

cat grafana.yaml

  1. apiVersion: extensions/v1beta1
  2. kind: Deployment
  3. metadata:
  4. name: grafana-core
  5. namespace: kube-system
  6. labels:
  7. app: grafana
  8. component: core
  9. spec:
  10. replicas:
  11. template:
  12. metadata:
  13. labels:
  14. app: grafana
  15. component: core
  16. spec:
  17. containers:
  18. - image: grafana/grafana:5.0.
  19. name: grafana-core
  20. imagePullPolicy: IfNotPresent
  21. resources:
  22. limits:
  23. cpu: 100m
  24. memory: 100Mi
  25. requests:
  26. cpu: 100m
  27. memory: 100Mi
  28. env:
  29. - name: GF_AUTH_BASIC_ENABLED
  30. value: "true"
  31. - name: GF_AUTH_ANONYMOUS_ENABLED
  32. value: "false"
  33. readinessProbe:
  34. httpGet:
  35. path: /login
  36. port:
  37. volumeMounts:
  38. - name: grafana-persistent-storage
  39. mountPath: /var
  40. volumes:
  41. - name: grafana-persistent-storage
  42. emptyDir: {}
  43.  
  44. ---
  45. apiVersion: v1
  46. kind: Service
  47. metadata:
  48. name: grafana
  49. namespace: kube-system
  50. labels:
  51. app: grafana
  52. component: core
  53. spec:
  54. type: NodePort
  55. ports:
  56. - port:
  57. nodePort:
  58. selector:
  59. app: grafana

部署grafana

  1. kubectl create -f grafana.yaml

查看grafana pod和service

  1. # kubectl get pod -n kube-system
  2. NAME READY STATUS RESTARTS AGE
  3. coredns-779dfc4d59-rtpmk / Running 101m
  4. grafana-core-6759c8945-5f4sv / Running 91m
  5. kubernetes-dashboard-b54f75c69-tnn4h / Running 3h11m
  6. node-exporter-sflqg / Running 110m
  7. node-exporter-xfsf8 / Running 110m
  8. prometheus-58dc44f44c-z86rv / Running 109m
  1. # kubectl get svc -n kube-system
  2. NAME TYPE CLUSTER-IP EXTERNAL-IP PORT(S) AGE
  3. grafana NodePort 10.250.1.230 <none> :/TCP 93m
  4. kube-dns ClusterIP 10.250.0.2 <none> /UDP,/TCP 103m
  5. kubernetes-dashboard NodePort 10.250.1.89 <none> :/TCP 3h23m
  6. node-exporter NodePort 10.250.0.165 <none> :/TCP 112m
  7. prometheus NodePort 10.250.0.53 <none> :/TCP 111m

可以看到grafana nodeport端口为31000,可使用nodeip+nodeport的方式访问grafana  http://10.40.0.152:31000

默认用户名和密码都是admin

配置数据库源为prometheus,导入面板

可以直接输入模板编号315在线导入,或者下载好对应的json模板文件本地导入,面板模板下载地址https://grafana.com/dashboards/315

在线加载模板OK,选择prometheus数据库实例

大功告成,可以看到炫酷的监控页面了。

Kubernetes使用prometheus+grafana做一个简单的监控方案的更多相关文章

  1. 【Bugly干货分享】一起用 HTML5 Canvas 做一个简单又骚气的粒子引擎

    Bugly 技术干货系列内容主要涉及移动开发方向,是由Bugly邀请腾讯内部各位技术大咖,通过日常工作经验的总结以及感悟撰写而成,内容均属原创,转载请标明出处. 前言 好吧,说是“粒子引擎”还是大言不 ...

  2. 使用React并做一个简单的to-do-list

    1. 前言 说到React,我从一年之前就开始试着了解并且看了相关的入门教程,而且还买过一本<React:引领未来的用户界面开发框架 >拜读.React的轻量组件化的思想及其virtual ...

  3. 【 D3.js 入门系列 --- 3 】 做一个简单的图表!

    前面说了几节,都是对文字进行处理,这一节中将用 D3.js 做一个简单的柱形图. 做柱形图有很多种方法,比如用 HTML 的 div 标签,或用 svg . 推荐用 SVG 来做各种图形.SVG 意为 ...

  4. 一起用HTML5 canvas做一个简单又骚气的粒子引擎

    前言 好吧,说是"粒子引擎"还是大言不惭而标题党了,离真正的粒子引擎还有点远.废话少说,先看demo 本文将教会你做一个简单的canvas粒子制造器(下称引擎). 世界观 这个简单 ...

  5. Jmeter初步使用二--使用jmeter做一个简单的性能测试

    经过上一次的初步使用,我们懂得了Jmeter的安装与初步使用的方法.现在,我们使用Jmeter做一个简单的性能测试.该次测试,提交的参数不做参数化处理,Jmeter各元件使用将在介绍在下一博文开始介绍 ...

  6. 用EF DataBase First做一个简单的MVC3报名页面

    使用EF DataBase First做一个简单的MVC3报名网站 ORM(Object Relational Mapping)是面向对象语言中的一种数据访问技术,在ASP.NET中,可以通过ADO. ...

  7. 【 D3.js 入门系列 — 3 】 做一个简单的图表!

    图1. 柱形图 1. 柱形图 前几章的例子,都是对文字进行处理.本章中将用 D3 做一个简单的柱形图.制作柱形图有很多种方法,比如用 HTML 的 <div> 标签,或在 SVG 上绘制 ...

  8. Windows Phone开发(21):做一个简单的绘图板

    原文:Windows Phone开发(21):做一个简单的绘图板 其实我们今天要说的就是一个控件--InkPresenter,这个控件并不是十分强大,没办法和WPF中的InkCanvas相比,估计在实 ...

  9. 使用Multiplayer Networking做一个简单的多人游戏例子-3/3(Unity3D开发之二十七)

    使用Multiplayer Networking做一个简单的多人游戏例子-1/3 使用Multiplayer Networking做一个简单的多人游戏例子-2/3 使用Multiplayer Netw ...

随机推荐

  1. java线程池ThreadPoolExecutor的使用

    package s.b.foo.caze.thread; import java.io.Serializable; import java.util.concurrent.ArrayBlockingQ ...

  2. 从dao层查出的数据到页面时数值都是零的异常

    异常问题: IllegalArgumentException: argument type mismatch at cn.tedu.utils.BeanListHandler.handle(BeanL ...

  3. HDU 6342.Problem K. Expression in Memories-模拟-巴科斯范式填充 (2018 Multi-University Training Contest 4 1011)

    6342.Problem K. Expression in Memories 这个题就是把?变成其他的使得多项式成立并且没有前导零 官方题解: 没意思,好想咸鱼,直接贴一篇别人的博客,写的很好,比我的 ...

  4. ASP.NET Core 2.2 基础知识(十五) Swagger

    安装 Nuget 包 注册 Swagger public void ConfigureServices(IServiceCollection services) { services.AddMvc() ...

  5. ( 转 ) 优秀REST风格 API的设计原则

    设计优秀的REST风格API非常困难!API是服务提供方和使用方之间的契约,打破该契约将会给服务端开发人员招来非常大的麻烦,这些麻烦来自于使用API的开发人员,因为对API的改动会导致他们的移动app ...

  6. 谜题12:ABC

    这个谜题要问的是一个悦耳的问题,下面的程序将打印什么呢? public class ABC{ public static void main(String[] args){ String letter ...

  7. java.lang.ClassCastException: com.sun.proxy.$Proxy13 cannot be cast to sm.dao.UserDao

    在Spring中添加事物管理以后出现的问题 源代码 ApplicationContext applicationContext = new ClassPathXmlApplicationContext ...

  8. POJ 3709 K-Anonymous Sequence(斜率优化DP)

    [题目链接] http://poj.org/problem?id=3709 [题目大意] 给出一个长度为n个非严格单调递增数列,每次操作可以使得其中任意一项减一, 问现在使得数列中每项数相同的数的数量 ...

  9. Redis核心解读

    http://www.wzxue.com/redis核心解读/

  10. 《新一代视频压缩码标准-H.264_AVC》读书笔记1

    摘要 第一章 绪论 正文 1.一般而言,视频信号信息量大,传输网络所需要的带宽相对较宽.例如,一路可视电话或会议电视信号,由于其活动内容较少,所需带宽较窄,但要达到良好质量,不压缩约需若干 Mbps, ...