pig的cogroup详解

从实例出发

%default file test.txt

A = load '$file' as (date, web, name, food);

B = load '$file' as (date, web, name, food);

C= cogroup A by $0, B by $1;

describe C;

illustrate C;

dump C;

cogroup命令中$0和$1，两个列的内容如果不一样，就是分别生成两个批次的group，先按A值分组，在按B对应的值分组。按A的值分组时，B对应的为空，则group中有一个空组{}；但如果内容一样，如C= cogroup A by $1, B by $1;就是生成一个批次的group，其中包含A和B两个表中所有的等于该值的元组。

COGROUP与join的区别：自己懒得写，摘自网络

Join的操作结果是平面的（一组元组），而COGROUP的结果是有嵌套结构的。

运行以下命令：

r1 = cogroup r_student by classNo,r_teacher by classNo;

dump r1;

结果如下：

(C01,{(C01,N0103,65),(C01,N0102,59),(C01,N0101,82)},{(C01,Zhang)})

(C02,{(C02,N0203,79),(C02,N0202,82),(C02,N0201,81)},{(C02,Sun)})

(C03,{(C03,N0306,72),(C03,N0302,92),(C03,N0301,56)},{(C03,Wang)})

(C04,{},{(C04,Dong)})

由结果可以看出：

1）  cogroup和join操作类似。

2）  生成的关系有3个字段。第一个字段为连接字段；第二个字段是一个包，值为关系1中的满足匹配关系的所有元组；第三个字段也是一个包，值为关系2中的满足匹配关系的所有元组。

3）  类似于Join的外连接。比如结果中的第四个记录，第二个字段值为空包，因为关系1中没有满足条件的记录。实际上第一条语句和以下语句等同：

r1= cogroup r_student by classNo outer,r_teacher by classNo outer;

如果你希望关系1或2中没有匹配记录时不在结果中出现，则可以分别在关系中使用inner而关键字进行排除。

执行以下语句：

r1 = cogroup r_student by classNo inner,r_teacher byclassNo outer;

dump r1;

结果为：

(C01,{(C01,N0103,65),(C01,N0102,59),(C01,N0101,82)},{(C01,Zhang)})

(C02,{(C02,N0203,79),(C02,N0202,82),(C02,N0201,81)},{(C02,Sun)})

(C03,{(C03,N0306,72),(C03,N0302,92),(C03,N0301,56)},{(C03,Wang)})

flatten执行命令：

r2 = foreach r1 generate flatten($1),flatten($2);

dump r2;

结果如下：

(C01,N0103,65,C01,Zhang)

(C01,N0102,59,C01,Zhang)

(C01,N0101,82,C01,Zhang)

(C02,N0203,79,C02,Sun)

(C02,N0202,82,C02,Sun)

(C02,N0201,81,C02,Sun)

(C03,N0306,72,C03,Wang)

(C03,N0302,92,C03,Wang)

(C03,N0301,56,C03,Wang)

可以看到，两个同时flatten，会自动映射生成多列。

针对cogroup，我测试了一下，核心代码如下：

industry_existed_Data = LOAD '$industryPath' USING PigStorage(',') AS (industryId:chararray,guid:chararray,sex:chararray,log_type:chararray);

sample_data = limit industry_existed_Data 20;

--STORE sample_data INTO '/user/wizad/tmp/industry_existed_Data' USING PigStorage(',');

--merge with history data

cogroupIndustryExistCurrentByGuid = COGROUP industry_existed_Data by guid, industry_current_data by guid;

mydata = sample cogroupIndustryExistCurrentByGuid 0.1;

dump mydata;

describe cogroupIndustryExistCurrentByGuid;

--dump cogroupIndustryExistCurrentByGuid;

--STORE mycogroupdata INTO '/user/wizad/tmp/cogroupIndustryExistCurrentByGuid' USING PigStorage(',');

look_for_cogroup = FOREACH cogroupIndustryExistCurrentByGuid GENERATE $0,$2;

describe look_for_cogroup;

IndustryStorageDataTmp = FOREACH cogroupIndustryExistCurrentByGuid GENERATE FLATTEN($2);

IndustryStorageData = DISTINCT IndustryStorageDataTmp;

describe IndustryStorageData;

显示结果：

三个数据的结构如下

cogroupIndustryExistCurrentByGuid:

{

group: chararray,

industry_existed_Data:{industryId: chararray,guid: chararray,sex: chararray,log_type: chararray},

industry_current_data: {joined_ad_campaign_data::industryId: chararray,joined_Orgin_sex_data::distinct_origin_historical_sex::guid: chararray,joined_Orgin_sex_data::social_sex::sex: chararray,joined_Orgin_sex_data::distinct_origin_historical_sex::log_type:
chararray}

}

look_for_cogroup:

{

group: chararray,

industry_current_data: {joined_ad_campaign_data::industryId: chararray,joined_Orgin_sex_data::distinct_origin_historical_sex::guid: chararray,joined_Orgin_sex_data::social_sex::sex: chararray,joined_Orgin_sex_data::distinct_origin_historical_sex::log_type:
chararray}

}

IndustryStorageData:

{

industry_current_data::joined_ad_campaign_data::industryId: chararray,

industry_current_data::joined_Orgin_sex_data::distinct_origin_historical_sex::guid: chararray,

industry_current_data::joined_Orgin_sex_data::social_sex::sex: chararray,

industry_current_data::joined_Orgin_sex_data::distinct_origin_historical_sex::log_type: chararray

}

可以看出三个数据的结构很复杂，因为前面做关联所以包含了对象名（或者叫域名），指明属于哪个对象。可以只看最后一列名字和格式。

第三个是flatten（$2）的结果。

cogroup有空集问题，就是对应group中的每个值（cogroup用来关联的key的取值），两个集合各自按key值进行group后，某些key对应的集合为空。

上面的pig代码的实际数据如下，guid作为关联key，可以看出很多空集{}，出现在某些guid的取值对应集合后。

所以取数据时要注意，只flatten某一列，会造成其他列数据丢失，因为对应着该flatten列的空集。

((-1,),{(74,9051235c-a391-4dae-ab22-f93d24a12636,-1,-1,),(75,053e9f48-03bf-4b39-9455-ff412a725a3c,-1,-1,),(74,21ca723c-ec2b-4242-8108-b95436f10e3e,-1,-1,),(74,fec1932a-b0e4-4bf0-b504-8ed8f3c159e7,-1,-1,),(74,d74374ec-8cf4-4c4a-b598-9631f6972cbb,-1,-1,),(74,6780962a-bf75-4c4c-a557-94a7de5a3e36,-1,-1,),(74,14517915-ee3f-4d34-943f-d6f1813afdef,-1,-1,),(74,c5547aca-3b8b-4108-93ba-bf365c106cdd,-1,-1,),(74,e9a986c1-6868-4f7f-baf6-69d8c302583e,-1,-1,),(74,9c1341cf-45b8-48c6-b699-33b1a4215c66,-1,-1,),(74,f16e6222-a84b-4758-ae71-0613c8f34b29,-1,-1,),(74,47cc25ef-05bc-47f4-a32b-3cddaf0ac22b,-1,-1,),(74,d5c1b6b0-38c3-464b-8cb9-70ced875be5f,-1,-1,),(74,6a4f782a-1f5c-45c0-bb3a-4df25c436be3,-1,-1,),(74,23bb2f0c-d629-479d-800e-b86fc3d6e45c,-1,-1,)})

((a50a17bde79ac018,),{(74,863010025134441,a50a17bde79ac018,863010025134441,)})

((a51779f736cd3f54,),{(74,862949029595753,a51779f736cd3f54,862949029595753,)})

((c7ae5867-3b77-4987-b082-ed3867b5c384,),{(74,353627055387065,c7ae5867-3b77-4987-b082-ed3867b5c384,353627055387065,)})

pig的cogroup详解的更多相关文章

Linux 之编译器 gcc/g++参数详解
2016年12月9日16:48:53 ----------------------------- 内容目录: [介绍] gcc and g++分别是gnu的c & c++编译器 gcc/g++ ...
gcc命令行详解
介绍] ----------------------------------------- 常见用法: GCC 选项 GCC 有超过100个的编译选项可用. 这些选项中的许多你可能永远都不会用到, 但 ...
转】Mahout推荐算法API详解
原博文出自于: http://blog.fens.me/mahout-recommendation-api/ 感谢! Posted: Oct 21, 2013 Tags: itemCFknnMahou ...
[转]GCC参数详解
[介绍] gcc and g++分别是gnu的c & c++编译器 gcc/g++在执行编译工作的时候,总共需要4步 1.预处理,生成.i的文件[预处理器cpp] 2.将预处理后的文件不转换成 ...
scons用户指南翻译(附gcc/g++参数详解)
scons用户指南翻译 http://blog.csdn.net/andyelvis/article/category/948141 官网文档 http://www.scons.org/docume ...
Hadoop 新 MapReduce 框架 Yarn 详解
Hadoop 新 MapReduce 框架 Yarn 详解: http://www.ibm.com/developerworks/cn/opensource/os-cn-hadoop-yarn/ Ap ...
Zookeeper客户端Curator使用详解
Zookeeper客户端Curator使用详解前提最近刚好用到了zookeeper,做了一个基于SpringBoot.Curator.Bootstrap写了一个可视化的Web应用: zookeep ...
大数据入门第十六天——流式计算之storm详解（一）入门与集群安装
一.概述今天起就正式进入了流式计算.这里先解释一下流式计算的概念离线计算离线计算:批量获取数据.批量传输数据.周期性批量计算数据.数据展示代表技术:Sqoop批量导入数据.HDFS批量存储数据 ...
[转]Mahout推荐算法API详解
Mahout推荐算法API详解 Hadoop家族系列文章,主要介绍Hadoop家族产品,常用的项目包括Hadoop, Hive, Pig, HBase, Sqoop, Mahout, Zookeepe ...

随机推荐

JAVA反射之Class类的练习
package zhang; /** * JAVA反射之CLass类的练习 * * 在面向对象的语言里,万事万物皆对象,那么类是谁的对象呢? * 类的类型是CLass * * */ class Tes ...
python笔记二（数据类型和变量、编码方式、字符串的编码、字符串的格式化）
一.数据类型 python可以直接处理的数据类型有:整数.浮点数.字符串.布尔值.空值. 整数浮点数字符串:双引号内嵌套单引号,可以输出 i'm ok. 也可以用\来实现,\n 换行 \t tab ...
MLDS笔记：Optimization
当函数空间覆盖到目标函数时,如何通过优化调整神经网络的参数找到这个目标函数呢? 深度学习中的损失函数是非凸的,非凸优化是个NP-hard问题,如何通过梯度下降来解决这个问题呢? 注意,不同于learn ...
ACM 畅通工程
Problem Description 某省调查城镇交通状况,得到现有城镇道路统计表,表中列出了每条道路直接连通的城镇.省政府"畅通工程"的目标是使全省任何两个城镇间都可以实现交通 ...
Android-Tab
SmartTabLayout 我的地址:https://github.com/kongqw/Android-Tab 开源地址:https://github.com/ogaclejapan/SmartT ...
springMVC源码分析--异常处理机制HandlerExceptionResolver执行原理（二）
上一篇博客springMVC源码分析--异常处理机制HandlerExceptionResolver简单示例(一)中我们简单地实现了一个异常处理实例,接下来我们要介绍一下HandlerExceptio ...
Dynamics CRM 权限整理二
接上篇http://blog.csdn.net/vic0228/article/details/50510605,继续列举CRM相关权限 prvReadBusinessUnit privilege(I ...
【C++】处理CSDN博文源码
为了简化CSDN写博客的字体问题,给出一段代码,用于处理使用默认格式写完博客后,处理一次来解决字体问题. 代码片段代码片段如下所示: #include <iostream> #inclu ...
向VS中添加个PATH怎么样？
属性中,有个调试的目录,向"环境"中添加: PATH="your path";$(PATH) 可以调试用一下.
Shell脚本生成网页版相册浏览器
今天学到了一招,那就是使用脚本制作一款网页版相册浏览器.先上图吧. 必备基础操作系统: 以linux为内核的操作系统都行编程语言:Shell(bash)脚本,相关基础知识即可下载工具:wget ...

pig的cogroup详解

pig的cogroup详解的更多相关文章

随机推荐

热门专题