Pig Latin – 编码无悔 / Intent & Focused

[原创] 如何减少map-only的Pig job的输出文件数

2023 年 11 月 18 日2019 年 08 月 11 日作者 learnhard

查看更多Apache Pig的教程请点击这里。

如果一个Pig job是map-only的job，并且其输入文件数很多的话，那么输出的文件数也会同样多，此时，如果每个文件大小又比较小的话，长久下去就会对Haodoop NameNode造成很大压力。我们可以通过给Pig job添加一个reduce过程来减少输出文件数。

[原创]Apache Pig的一些基础概念及用法总结（2）

2022 年 05 月 10 日2012 年 04 月 05 日作者 learnhard

查看更多Apache Pig的教程请点击这里。

▶▶ LIMIT操作并不会减少读入的数据量
如果你只需要输出一个小数据集，通常你可以使用LIMIT来实现，例如：

A = LOAD '1.txt' AS (col1: int, col2: chararray);
B = LIMIT A 5;
DUMP B;

Pig会只加载5条记录，就不再读取其他的记录了吗？答案是：不会。Pig将读取数据文件中的所有记录，然后再从中挑5条。这是Pig可以做优化、却没有做的一点。
【更新】Pig 0.10已经有了这功能了：

Push Limit into Loader

Pig optimizes limit query by pushing limit automatically to the loader, thus requiring only a fraction of the entire input to be scanned.

按我的理解，上面这段话的含义是：Pig将LIMIT查询自动优化到loader中，这样就只会扫描整个输入数据集的一部分（而不是全部）。

文章来源：http://www.codelast.com/
▶▶ 使用UDF不一定要在Pig脚本中REGISTER，也可以在命令行指定
大家知道，使用UDF需要在Pig脚本中REGISTER该UDF的jar包，但你可能不知道，你也可以不在Pig脚本中REGISTER它，而是通过命令行指定：

pig -Dpig.additional.jars=/home/codelast/a.jar:/home/codelast/b.jar:/home/codelast/c.jar test.pig

以上命令告诉了我们几件事：
①我们让Pig执行了test.pig脚本；
②我们向Pig传入了“pig.additional.jars”这样一个参数，此参数的作用相当于在Pig脚本中REGISTER jar包；
③如果你要REGISTER多个jar包，只需像上面的例子一样，用分号(:)把多个jar包路径隔开即可；
④test.pig必须写在最后，而不能写成“pig test.pig -Dpig.additional.jars=XXX”这样，否则Pig直接报错：

ERROR 2999: Unexpected internal error. Encountered unexpected arguments on command line - please check the command line.

当然，为了可维护性好，你最好把REGISTER jar包写在Pig脚本中，不要通过命令行传入。

[原创]Apache Pig中文教程（进阶）

2023 年 11 月 18 日2012 年 03 月 15 日作者 learnhard

本文包含Apache Pig的一些进阶技巧及用法小结。如要学习基础教程，请查看我写的【其他几篇文章】。
本文的大量实例都是作者Darran Zhang（website: codelast.com）在工作、学习中总结的经验或解决的问题，并且添加了较为详尽的说明及注解，此外，作者还在不断地添加本文的内容，希望能帮助一部分人。

Apache Pig是用来处理大规模数据的高级查询语言，配合Hadoop使用，可以在处理海量数据时达到事半功倍的效果，比使用Java，C++等语言编写大规模数据处理程序的难度要小N倍，实现同样的效果的代码量也小N倍。