Logstash：运用 fingerprint 过滤器处理重复的文档

文章转载自：https://blog.csdn.net/UbuntuTouch/article/details/106639848

背景：Elasticsearch 索引

在介绍重复数据删除解决方案之前，让我们简要介绍一下 Elasticsearch 的索引编制过程。 Elasticsearch 提供了一个 REST API 来为你的文档建立索引。你可以选择提供唯一代表您的文档的 ID，也可以让 Elasticsearch 为你生成ID。如果您将 HTTP PUT 与索引API 一起使用，Elasticsearch 希望您提供一个ID。如果已经存在具有相同 ID 的文档，Elasticsearch 将用你刚才提供的文档替换现有内容-最后索引的文档将获胜。如果使用 POST 动词，则即使语料库中已经存在内容，Elasticsearch 也会生成具有新ID的新文档。例如，假设你刚在一秒钟之前为博客文章建立了索引，并使用 POST 动词重新发送了同一篇博客文章，Elasticsearch 创建了另一个具有相同内容但新具有 ID 的文档。

虽然 Elasticsearch 提供了一个显式的 _update API，可以将其用作潜在的解决方法，但我们将把本文重点放在索引 API 上。

Logstash 的 Elasticsearch 输出使用索引API，并且默认情况下不希望提供 ID。因此，它将每个单个事件视为单独的文档。但是，有一个选项可让你轻松为 Logstash 中的每个事件设置唯一的 ID。

删除重复的相似内容

如前所述，在你的用例中，重复的内容可能是不可接受的。使用称为指纹的概念和 Logstash 指纹过滤器（fingerprint），您可以创建一个称为指纹的新字符串字段，以唯一地标识原始事件。指纹过滤器可以将原始事件中的一个或多个字段（默认为消息字段）作为源来创建一致的哈希值 (hash)。一旦创建了这些指纹，你就可以将其用作下游Elasticsearch输出中的文档ID。这样，Elasticsearch 将仅在比较指纹后更新或覆盖现有文档内容，但绝不会复制它们。如果你想考虑更多字段以进行删除重复数据，则可以使用 concatenate_sources 选项。

指纹过滤器具有多种算法，您可以选择创建此一致的哈希（hash）。请参阅文档，因为每个函数的哈希强度不同，可能需要其他选项。在下面的示例中，我们使用 MURMUR3 方法从消息字段创建哈希并将其设置在元数据字段中。元数据字段不会发送到输出，因此它们提供了一种在处理管道中的事件时临时存储数据的有效方法。

filter {

  fingerprint {

    source => "message"

    target => "[@metadata][fingerprint]"

    method => "MURMUR3"

  }

}

output {

  elasticsearch {

    hosts => "example.com"

    document_id => "%{[@metadata][fingerprint]}"

  }

}

如果使用任何加密哈希函数算法（例如SHA1，MD5），则需要提供密钥选项。密钥可以是用于计算 HMAC 的任意字符串。

filter {

  fingerprint {

    source => "message"

    target => "[@metadata][fingerprint]"

    method => "SHA1",

    key => "Log analytics",

    base64encode => true

  }

}

output {

  elasticsearch {

    hosts => "example.com"

    document_id => "%{[@metadata][fingerprint]}"

  }

}

密钥的其他示例可以是 departmentID，组织 ID 等。

意外重复：从 Logstash 生成 UUID

先前的用例涉及内容的有意识地删除重复数据。在某些部署中，尤其是 Logstash 与可确保至少交付一次的持久性队列或其他排队系统一起使用时，Elasticsearch 中可能存在重复项。如果 Logstash 在处理过程中崩溃，则重新启动时将重播队列中的数据-这可能导致重复。为了减少这种情况造成的重复，可以对每个事件使用 UUID。这里的重点是，在将数据序列化到消息队列之前，需要在生产方（即发布到排队系统的 Logstash 实例）上生成UUID。这样，Logstash使用者在从崩溃还原或重新启动时需要重新处理事件时，将保留相同的事件ID。

如果你的源数据没有唯一标识符，则可以使用同一指纹过滤器来生成 UUID。请记住，此方法不考虑事件本身的内容，而是为每个事件生成 version 4 UUID。

filter {

  fingerprint {

    target => "%{[@metadata][uuid]}"

    method => "UUID"

  }

}

output {

  elasticsearch {

    hosts => "example.com"

    document_id => "%{[@metadata][uuid]}"

  }

}

如果在 Logstash 生产者和使用者之间使用队列，则必须显式复制@metadata字段，因为它们不会持久化到输出中。另外，你可以使用以下常规字段：

filter {

  fingerprint {

    target => "generated_id"

    method => "UUID"

  }

}

output {

  kafka {

    brokers => "example.com"

    ...

  }

}

从消费者方面，您可以只使用：

input {

  kafka {

    brokers => "example.com"

  }

}

output {

  elasticsearch {

    hosts => "example.com"

    document_id => "%{[generated_id]}"

  }

}

例子

在下面，我们用一个实际的例子来展示，这个是如工作的。首先让我们先创建一个叫做 logstash_fingerprint.conf 的 Logstash 配置文件：

logstash_fingerprint.conf

input {

    http {

        id => "data_http_input"

    }

}

filter {

    fingerprint {

        source => [ "sensor_id", "date"]

        target => "[@metadata][fingerprint]"

        method => "SHA1"

        key => "liuxg"

        concatenate_sources => true

        base64encode => true

    }

}

output {

    stdout {

     codec => rubydebug

    }

  elasticsearch {

    manage_template => "false"

    index => "fingerprint"

    hosts => "localhost:9200"

    document_id => "%{[@metadata][fingerprint]}"

    }

}

在这里，我们使用 http input 来收集数据。使用 sensor_id 及 date 这两个字段来生成一个 fingerprint。也就是说，只有这两个字段是一样的，那么无论我们输入多少次数据，那么在 Elasticsearch 中将不会有新的数据生成，因为它们的 ID 都是一样的。我们启动 Logstash：

sudo ./bin/logstash -f ~/data/fingerprint/logstash_fingerprint.conf

我们可以在另外一个 console 中打入如下的命令：

curl -XPOST --header "Content-Type:application/json"http://localhost:8080/" -d '{"sensor_id":1, "date": "2015-01-01", "reading":16.24}'

我们发现，只要是 sensor_id 和 date 的值都是一样的，那么 fingerprint 的文档数永远是 1。当然你也可以更新其它字段的值，比如 reading 字段的值为20，那么新的值将会在里面得以体现。这个操作相当于更新的操作。

也就是说，在索引 fingerprint 中，只要是 sensor_id 及 date 的数值是一样的，那么我们将永远只有一个文档，而且是永远不会重复的。

Logstash：运用 fingerprint 过滤器处理重复的文档的更多相关文章

ELK（ ElasticSearch+ Logstash+ Kibana）分布式日志系统部署文档
开始在公司实施的小应用,慢慢完善之~~~~~~~~文档制作了好作运维同事之间的前期普及.. ~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~~ 软件下载地址: https://www.e ...
13.Django1.11.6文档
第一步入门检查版本 python -m django --version 创建第一个项目 django-admin startproject mysite 运行 python manage.py ...
mongoDB 文档操作_增
增加 / 插入 /保存单文档插入命令 db.collection.insertOne(doc) 功能向被 use 的数据库中插入数据实例 db.class.insertOne({"n ...
day56 文件文档处理,事件
前情回顾: 1. 前情回顾 0. 选择器补充 - 属性选择器 - $("[egon]") - $("[type='text']") - $("inpu ...
jQuery 选择器筛选器样式操作文本操作属性操作文档处理事件动画效果插件 each、data、Ajax
jQuery jQuery介绍 1.jQuery是一个轻量级的.兼容多浏览器的JavaScript库. 2.jQuery使用户能够更方便地处理HTML Document.Events.实现动画效果.方 ...
jQuery文档节点处理，克隆，each循环，动画效果，插件
文档节点处理 //创建一个标签对象 $("<p>") //内部插入 $("").append(content|fn) ----->$(&quo ...
写文档太麻烦，试试这款 IDEA 插件吧！
前言每次开发完新项目或者新接口功能等,第一件事就是提供接口文档.说到接口文档,当然是用 Markdown 了.各种复制粘贴字段,必填非必填,字段备注,请求返回示例等等.简直是浪费时间哇.所以想到了开 ...
logstash的mutate过滤器的使用
logstash的mutate过滤器的使用一.背景二.需求三.实现步骤 1.安装 `csv codec` 插件 2.准备需要读取的文件数据 3.编写 pipeline ,读取和输出数据 4.mu ...
XML文档形式&JAVA抽象类和接口的区别&拦截器过滤器区别
XML文档定义有几种形式?它们之间有何本质区别?解析XML文档有哪几种方式? a: 两种形式 dtd schemab: 本质区别:schema本身是xml的,可以被XML解析器解析(这也是从DTD上发 ...

随机推荐

Java 内存模型，或许应该这么理解
大家好,我是树哥. 在前面一段时间,我连续写了几篇关于并发编程的文章: 从 CPU 讲起,深入理解 Java 内存模型! - 陈树义的博客深入理解 happens-before 原则 - 陈树义的博 ...
Java 中的对象池实现
点赞再看,动力无限.Hello world : ) 微信搜「程序猿阿朗」. 本文 Github.com/niumoo/JavaNotes 和未读代码博客已经收录,有很多知识点和系列文章. 最近在 ...
用KVM安装MacOS/OSX
基本步骤按照大牛的步骤https://github.com/kholia/OSX-KVM 黑果镜像建议用黑果小兵的:macOS Big Sur(我试过,大牛的更卡),里面的双EFI就很够用. 将镜像名 ...
SQLZOO练习四--SUM and COUNT（聚合函数）
World Country Profile: Aggregate functions This tutorial is about aggregate functions such as COUNT, ...
2022-7-11 javascript学习第七组刘昀航
JavaScript是什么? 编程语言,脚本语言,依赖于某种容器来运行. JS是运行在浏览器上的,可以帮助我们去控制页面. Vue.js react.js jquery.js an ...
利用Kaptcha.jar生成图片验证码（以下源码可以直接复制并自定义修改）
说明:Kaptcha是一个很实用的验证码生成工具,它可以生成各种样式的验证码,因为它是可以配置的目录: 一实现步骤二实例 A 编写jsp页面 B 配置web.xml C 验证输入正确与否. 一 ...
python开发环境配置（Windows）
简介由于在搭建pyhon开发环境时会出现各种各样的问题,因此将这些问题记录下来 1.下载python 从官网下载对应系统的python版本(最新稳定版即可):官网地址为:python下载地址, 建议 ...
GreatSQL MGR FAQ
欢迎来到 GreatSQL社区分享的MySQL技术文章,如有疑问或想学习的内容,可以在下方评论区留言,看到后会进行解答目录 0. GreatSQL简介 1. GreatSQL的特色有哪些 2. Gr ...
(防坑)Alphafold 非docker 安装指南
本指南适用于Linux系统.Alphafold官方也强调尽量使用Linux系统!官方提供了docker版安装步骤. Alphafold简介: 强大的蛋白质结构预测. 开源地址:https://gith ...
Python爬虫之xpath语法及案例使用
Python爬虫之xpath语法及案例使用 ---- 钢铁侠的知识库 2022.08.15 我们在写Python爬虫时,经常需要对网页提取信息,如果用传统正则表达去写会增加很多工作量,此时需要一种对数 ...

Logstash：运用 fingerprint 过滤器处理重复的文档

Logstash：运用 fingerprint 过滤器处理重复的文档的更多相关文章

随机推荐

热门专题