logstash nested内嵌字段 field protobuf解码 codec 的解决办法
logstash nested内嵌字段 field protobuf解码 codec 的解决办法
主要需求
logstash-codec 下
https://www.elastic.co/guide/en/logstash/6.3/codec-plugins.html
此类解码器
只能应用在原始数据上
比如 https://www.elastic.co/guide/en/logstash/6.3/plugins-codecs-protobuf.html
kafka
{
zk_connect => "127.0.0.1"
topic_id => "your_topic_goes_here"
codec => protobuf
{
class_name => "Animal::Unicorn"
include_path => ['/path/to/protobuf/definitions/UnicornProtobuf.pb.rb']
}
}
对从kafka获取的原始数据进行解码
无法对应原始数据内部的某个字段解码
现在有一个应用场景 内嵌的某个字段是
encode_str= base64_encode(protobuf_encode())
{
"name":"cclient",
"encode_str":"....."
}
codec-plugins 只能应用在完整数据上,而无法应用在encode_str字段上
官方提供一个相关功能的filter
https://www.elastic.co/guide/en/logstash/6.3/plugins-filters-json.html
对内嵌的json字段串 进行json解析
首选的办法
1 自已实现相关插件,完成特定解码工作,实际工作量不大,因为logstash的官方插件都开源
https://github.com/logstash-plugins/logstash-codec-protobuf
https://github.com/logstash-plugins/logstash-filter-json
以我的需求为例,结合logstash-codec-protobuf 和 logstash-filter-json
就能实现一套对内嵌protobuf字段的解码工具
这也是首先想到的办法,但没有执行,主要考虑到,这种场景有一定的通用性
这里是protobuf,如果换成avro,又需要另写一个插件
所以这个方案先放一放(放了一个晚上,同事就已经实现,一共也只花了几小时)
2 这个方案初期只是猜想,并未验证,思路是,既然官方已经提供了许多的codec,同时提供了ruby filter https://www.elastic.co/guide/en/logstash/6.3/plugins-filters-ruby.html,可否通过ruby filter,调用相应的codec来实现相应的解码功能?
由于同事已经实现了方案一,我主要就把精力放在方案2的验证上,先放结果
*可行。
毕竟不是资深的ruby开发,踩了一些坑,多花了些时间
验证步骤
1 首先是验证ruby是否可引用包
网上有很多引用包的资料,但主要是官方包
首先验证json解析
def json_decode(bin)
return LogStash::Json.load(bin)
end
* 官方包可行。
* 第三方未知。
2 尝试引用Protobuf的包,并看可否解码
这里参考了logstash-codec-protobuf的源码
实现
https://github.com/logstash-plugins/logstash-codec-protobuf/blob/master/lib/logstash/codecs/protobuf.rb
def register
@metainfo_messageclasses = {}
@metainfo_enumclasses = {}
@metainfo_pb2_enumlist = []
include_path.each { |path| load_protobuf_definition(path) }
if @protobuf_version ==
@pb_builder = Google::Protobuf::DescriptorPool.generated_pool.lookup(class_name).msgclass
else
@pb_builder = pb2_create_instance(class_name)
end
end def decode(data)
if @protobuf_version ==
decoded = @pb_builder.decode(data.to_s)
h = pb3_deep_to_hash(decoded)
else
decoded = @pb_builder.parse(data.to_s)
h = decoded.to_hash
end
yield LogStash::Event.new(h) if block_given?
rescue => e
@logger.warn("Couldn't decode protobuf: #{e.inspect}.")
if stop_on_error
raise e
end
end # def decode
测试用例
https://github.com/logstash-plugins/logstash-codec-protobuf/blob/master/spec/codecs/protobuf_spec.rb
let(:plugin_unicorn) { LogStash::Codecs::Protobuf.new("class_name" => "Animal::Unicorn", "include_path" => [pb_include_path + '/pb2/unicorn.pb.rb']) }
before do
plugin_unicorn.register
end it "should return an event from protobuf encoded data" do data = {:colour => 'rainbow', :horn_length => , :last_seen => , :has_wings => true}
unicorn = Animal::Unicorn.new(data) plugin_unicorn.decode(unicorn.serialize_to_string) do |event|
expect(event.get("colour") ).to eq(data[:colour] )
expect(event.get("horn_length") ).to eq(data[:horn_length] )
expect(event.get("last_seen") ).to eq(data[:last_seen] )
expect(event.get("has_wings") ).to eq(data[:has_wings] )
end
end # it
看到这里就觉得方案大概率能行的通
尝试引用第三方包
require "logstash/codecs/protobuf"
plugin_unicorn = LogStash::Codecs::Protobuf.new("class_name" => "Tutorial::Person", "include_path" => ["/usr/share/logstash/protobuf.pb.rb","/usr/share/logstash/addressbook.pb.rb"],"protobuf_version" => )
plugin_unicorn.register def base64_decode(bin)
return Base64.decode64(bin)
end def protobuf_decode(bin)
return protobuf_event=plugin_unicorn.decode(bin)
end
启动成功
plugin_unicorn.register 是方法调用
*第三方包引用正常(前提是安装了这个包,例require "logstash/codecs/protobuf" 前提是 logstash-plugin install logstash-codec-protobuf)
但执行时报错,没有plugin_unicorn 空引用,猜测是作用域问题
查了下ruby的资料,plugin_unicorn 改为$plugin_unicorn(表示全局作用域),后没有空引用错误
require "logstash/codecs/protobuf"
$plugin_unicorn = LogStash::Codecs::Protobuf.new("class_name" => "Tutorial::Person", "include_path" => ["/usr/share/logstash/protobuf.pb.rb","/usr/share/logstash/addressbook.pb.rb"],"protobuf_version" => )
$plugin_unicorn.register def base64_decode(bin)
return Base64.decode64(bin)
end def protobuf_decode(bin)
return $protobuf_event=plugin_unicorn.decode(bin)
end
新问题是protobuf_decode返回为null,主要时间都花在这个问题上
首先样例数据是同事给的,确认了数据没有问题,调整验证了protobuf的版本,不行,最后试着自已生成了样例数据,问题依旧
注意力都在decode 方法上
def decode(data)
if @protobuf_version ==
decoded = @pb_builder.decode(data.to_s)
h = pb3_deep_to_hash(decoded)
else
decoded = @pb_builder.parse(data.to_s)
h = decoded.to_hash
end
yield LogStash::Event.new(h) if block_given?
rescue => e
@logger.warn("Couldn't decode protobuf: #{e.inspect}.")
if stop_on_error
raise e
end
end # def decode
试了多种情况都不成功,参照decode实现了decode_str
def decode_str(data_str)
@logger.info("cdp source: #{data_str}.")
if @protobuf_version ==
decoded = @pb_builder.decode(data_str)
h = pb3_deep_to_hash(decoded)
return h
else
decoded = @pb_builder.parse(data_str)
h = decoded.to_hash
@logger.info("cdp decoded: #{h}.")
return h
end
end # def decode
decode_str 成功解码
就原始需求来说,问题解决了,但说白了这是在原始插件上作定制,仍然是方案1,方案2的验证,还未结束
测试改代码的时候突然注意到了一个小区别
yield 和 return
ruby的yield细节还不清楚,但任python和nodejs的经验,yield和return的行为不一样是一定的,yield不会返回结果,并通常有个类似next的方法,yield应该是结果null的原因
简单了解ruby yield的相关资料
def protobuf_decode(bin)
return $protobuf_event=plugin_unicorn.decode(bin)
end
改为
def protobuf_decode(bin)
$plugin_unicorn.decode(bin) do |event|
return event.to_hash
end
end
方案二可行,完美
回头再看,yield的坑,完全可以避免
官方源码里的测试用例,有明显的do |event|,因为不熟悉ruby 直觉的写成了return,导致多花了很多时间排查
plugin_unicorn.decode(unicorn.serialize_to_string) do |event|
expect(event.get("colour") ).to eq(data[:colour] )
expect(event.get("horn_length") ).to eq(data[:horn_length] )
expect(event.get("last_seen") ).to eq(data[:last_seen] )
expect(event.get("has_wings") ).to eq(data[:has_wings] )
end
方案三
方案一是对单独的codec进行插件开发和定制
方案二验证可行,已经完全满足要求,且有一定的通用性,但是虽然不必为每种codec作定制,仍需简单修改相关代码,作插件的初始化(每个插件的参数并不相同)
plugin_unicorn = LogStash::Codecs::Protobuf.new("class_name" => "Tutorial::Person", "include_path" => ["/usr/share/logstash/protobuf.pb.rb","/usr/share/logstash/addressbook.pb.rb"],"protobuf_version" => )
是否可以开发一个过滤器,通过配置(配置沿用官方插件),完成对所有codes的解析?
这个待有精力再研究
logstash nested内嵌字段 field protobuf解码 codec 的解决办法的更多相关文章
- 一处折腾笔记:Android内嵌html5加入原生微信分享的解决的方法
有一段时间没有瞎折腾了. 这周一刚上班萌主过来反映说:微信里面打开聚客宝.分享功能是能够的(这里是用微信自身的js-sdk实现的).可是在android应用里面打开点击就没反应了:接下来狡猾的丁丁在产 ...
- sybase数据库和oracle数据库中字段中含有换行符的解决办法
最近在做数据库从sybase到oracle的迁移工作,sybase数据库表bcp导出后,通过sqlldr导入到oracle数据库,然后oracle数据库通过spool按照sybase数据库bcp的格式 ...
- DIV内英文或者数字不换行的问题 解决办法
word-wrap:break-word; word-break:break-all;
- IIS发布的网站,内网和外网不能访问的解决办法
A.关闭防火墙.控制面板-Windows防火墙-打开或关闭Windows防火墙(不推荐) B.打开:控制面板-Windows防火墙-高级设置-入站规则,在入站规则窗口中找到”BranchCache内容 ...
- IntelliJ IDEA的jsp中内置对象方法无法被解析的解决办法
主要原因是因为缺乏依赖 可以通过添加依赖的方式 导入servlet-api.jar,jsp-api.jar,tomcat-api.jar 这三个jar即可 这三个jar在tomcat的lib目录下有 ...
- phpexcel 导出数字类型字段导出错误或者为空解决办法 (原)
跟我们写excel时候一样,手机号或者较长的数字类型,或被科学计数法和谐,但是如果类型是字符串,长一些的数字就不受影响了. 解决导出被和谐的最简单易懂的,就是最前面拼接‘ ’ 空格,或者字母符号之类, ...
- iOS 内嵌 View 的响应
遇到一个问题就是我有一个 UITextField,点击后不能编辑而是会显示一个自定义的 dialog. 但发现问题是,UITextField 的对点击事件的反应非常吃顿,有时候好使有时候不好使. 后来 ...
- MongoDB内嵌文档操作
实体定义: [BsonIgnoreExtraElements] public class Person : BaseEntity { public string FirstName { get; se ...
- 匿名字段 内嵌结构体 interface作为struct field 匿名接口
interface作为struct field,谈谈golang结构体中的匿名接口 - Go语言中文网 - Golang中文社区 https://studygolang.com/articles/19 ...
随机推荐
- POJ 1164:The Castle
The Castle Time Limit: 1000MS Memory Limit: 10000K Total Submissions: 6677 Accepted: 3767 Descri ...
- dic
参考慕课网 内置函数 map(f,list) f接收一个参数 def format_name(s): return s[0].upper() + s[1:].lower() reduce(f,li ...
- 两个exe共享内存数据
unit Unit1; interface uses Windows, Messages, SysUtils, Variants, Classes, Graphics, Controls, Forms ...
- 【mac相关bash文件】
mac 下 关于 .bashrc 和 .bash_profile 1.首先.bashrc 可能自带的系统里没有这个文件. 2.bash_profile 里边一半放的是PATH相关. 3. .bash ...
- CSS 选择器权重计算规则(转)
其实,CSS有自己的优先级计算公式,而不仅仅是行间>内部>外部样式:ID>class>元素. 一.样式类型 1.行间 <h1 style="font-size: ...
- ERNIE:知识图谱结合BERT才是「有文化」的语言模型
自然语言表征模型最近受到非常多的关注,很多研究者将其视为 NLP 最重要的研究方向之一.例如在大规模语料库上预训练的 BERT,它可以从纯文本中很好地捕捉丰富的语义模式,经过微调后可以持续改善不同 N ...
- [腾讯 TMQ] 接口测试用例设计
接口测试 [腾讯 TMQ] 接口测试用例设计 腾讯移动品质中心 · 2018年01月17日 · 最后由 于静 回复于 20 天前 · 21794 次阅读 本帖已被设为精华帖! 目录 作者:刘燕 团队: ...
- Python笔记_第四篇_高阶编程_实例化方法、静态方法、类方法和属性方法概念的解析。
1.先叙述静态方法: 我们知道Python调用类的方法的时候都要进行一个实例化的处理.在面向对象中,一把存在静态类,静态方法,动态类.动态方法等乱七八糟的这么一些叫法.其实这些东西看起来抽象,但是很好 ...
- 1 PHP 5.3中的新特性
1 PHP 5.3中的新特性 1.1 支持命名空间 (Namespace) 毫无疑问,命名空间是PHP5.3所带来的最重要的新特性. 在PHP5.3中,则只需要指定不同的命名空间即可,命名空间的分隔符 ...
- 01 语言基础+高级:1-6 集合_day02【Collection、泛型】
day02[Collection.泛型] 主要内容 Collection集合 迭代器 增强for 泛型 教学目标 能够说出集合与数组的区别 说出Collection集合的常用功能 能够使用迭代器对集合 ...