Pig II (11) (Tối ưu hóa và thực thi Pig II) (Tiếng Anh)
- ページ数
- 19
- 形式
- PPTX
- サイズ
- 433 KB
- 年
- 2011
- Trường
- Duke University
- 閲覧数
- 0
- コメント
- 0
- Lượt tải
- 0
プレビューを生成中...
Slide bài giảng về tối ưu hóa và thực thi của Pig, giới thiệu kiến trúc và các kỹ thuật tối ưu như giảm quét, giảm số lượng MR job, giảm shuffle, xử lý skew, tối ưu bộ nhớ, và các mô hình thực thi cải tiến.
- ドキュメント名
- Pig II (11) (Tối ưu hóa và thực thi Pig II) (Tiếng Anh)
- 学校 / コース
- Duke University · Big Data
- 著者(ドキュメント内)
- Alan F. Gates
- 内容
- Tài liệu này cung cấp cái nhìn sâu sắc về kiến trúc và các phương pháp tối ưu hóa hiệu suất cho Apache Pig, bao gồm giảm thiểu I/O, số lượng job MapReduce, và xử lý dữ liệu lệch. Nó cũng thảo luận về quản lý bộ nhớ, khởi động job nhanh hơn và các mô hình thực thi cải tiến.
- 目次
- Who Am I?
- Who Are You?
- What Should We Optimize?
- Pig Deployment
- Pig Guts (i.e. Pig Architecture), p. 1
- Pig Guts, p. 2
- Pig Guts, p. 3
- It would be really cool if…
- Memory
- Reducing Spills to Disk
- Skew
- Reducing your Reducers
- (De)serialization
- Faster Job Startup
- Improved Execution Models
- Code Generation
- Learn More
- Questions?
- ページ数
- 19 ページ
- アップロード者
- Uni24h
説明
Trích nội dung tài liệu
Pig Optimization and Execution Alan F. Gates @alanfgates © Hortonworks Inc. 2011 Page 1 Who Am I? Pig committer and PMC Member HCatalog committer and mentor Member of ASF and Incubator PMC Co-founder of Hortonworks Author of Programming Pig from O’Reilly Photo credit: Steven Guarnaccia, The Three Little Pigs Who Are You? 3 What Should We Optimize? Minimize scans – Hadoop is still often I/O bound Minimize total number of MR jobs Minimize shuffle size and number of shuffles Avoid spills to disk Reduce or remove skew For small jobs, minimize start-up time 4 Pig Deployment No server, all optimization and planning done on the launching machine Job executes on cluster Pig resides on user machine or gateway Hadoop Cluster User machine Pig Guts (i.e. Pig Architecture), p. 1 Logical Plan Pig Latin Load A = LOAD ‘myfile’ AS (x, y, z); B = GROUP A by x; C = FILTER B by group > 0; D = FOREACH C GENERATE group, COUNT(A); STORE D INTO ‘output’; Group AST Filter Foreach Semantic Checks Store 6 Pig Guts, p. 2 MapReduce Plan Logical Plan Load Load Group Filter Filter Foreach Map Filter Rearrange Group Rule based optimizations Reduce Store 7 Foreach Package Store Foreach Pig Guts, p. 3 MapReduce Plan Map Map Filter Filter Rearrange Rearrange Combine Foreach Physical optimizations Reduce Package Reduce Package Foreach Foreach 8 It would be really cool if… Map Map Reduce Reduce Map Map Reduce Reduce Map Reduce What’s the right join algorithm here? Even with statistics it would be hard to know. Need on the fly execution plan rewrites. 9 Memory Java + memory management = oil + water Java types inefficient memory users (~4x disk size) Very difficult to tell how much memory you are using Originally tried to monitor memory use via MXBeans: FAIL! Now estimate number of records we can hold in memory and spill when we exceed; allow user to tune guess 10 Reducing Spills to Disk Select Map size an
よくある質問
このドキュメントは無料ですか?
はい。「Pig II (11) (Tối ưu hóa và thực thi Pig II) (Tiếng Anh)」は無料です。ログインして「ダウンロード」をクリックするだけで、元のファイルを取得できます。
このドキュメントは何ページありますか?
このドキュメントは 19 ページあります(Big Data コース用)。ダウンロードする前にオンラインでプレビューできます。
ダウンロードする前にプレビューできますか?
はい。このページにあるオンラインリーダーでドキュメントをプレビューし、その後ダウンロードするかどうかを決めることができます。
Pig II (11) (Tối ưu hóa và thực thi Pig II) (Tiếng Anh)
プレビューを生成中...
Trích nội dung tài liệu
Pig Optimization and Execution Alan F. Gates @alanfgates © Hortonworks Inc. 2011 Page 1 Who Am I? Pig committer and PMC Member HCatalog committer and mentor Member of ASF and Incubator PMC Co-founder of Hortonworks Author of Programming Pig from O’Reilly Photo credit: Steven Guarnaccia, The Three Little Pigs Who Are You? 3 What Should We Optimize? Minimize scans – Hadoop is still often I/O bound Minimize total number of MR jobs Minimize shuffle size and number of shuffles Avoid spills to disk Reduce or remove skew For small jobs, minimize start-up time 4 Pig Deployment No server, all optimization and planning done on the launching machine Job executes on cluster Pig resides on user machine or gateway Hadoop Cluster User machine Pig Guts (i.e. Pig Architecture), p. 1 Logical Plan Pig Latin Load A = LOAD ‘myfile’ AS (x, y, z); B = GROUP A by x; C = FILTER B by group > 0; D = FOREACH C GENERATE group, COUNT(A); STORE D INTO ‘output’; Group AST Filter Foreach Semantic Checks Store 6 Pig Guts, p. 2 MapReduce Plan Logical Plan Load Load Group Filter Filter Foreach Map Filter Rearrange Group Rule based optimizations Reduce Store 7 Foreach Package Store Foreach Pig Guts, p. 3 MapReduce Plan Map Map Filter Filter Rearrange Rearrange Combine Foreach Physical optimizations Reduce Package Reduce Package Foreach Foreach 8 It would be really cool if… Map Map Reduce Reduce Map Map Reduce Reduce Map Reduce What’s the right join algorithm here? Even with statistics it would be hard to know. Need on the fly execution plan rewrites. 9 Memory Java + memory management = oil + water Java types inefficient memory users (~4x disk size) Very difficult to tell how much memory you are using Originally tried to monitor memory use via MXBeans: FAIL! Now estimate number of records we can hold in memory and spill when we exceed; allow user to tune guess 10 Reducing Spills to Disk Select Map size an
- ドキュメント名
- Pig II (11) (Tối ưu hóa và thực thi Pig II) (Tiếng Anh)
- 学校 / コース
- Duke University · Big Data
- 著者(ドキュメント内)
- Alan F. Gates
- 内容
- Tài liệu này cung cấp cái nhìn sâu sắc về kiến trúc và các phương pháp tối ưu hóa hiệu suất cho Apache Pig, bao gồm giảm thiểu I/O, số lượng job MapReduce, và xử lý dữ liệu lệch. Nó cũng thảo luận về quản lý bộ nhớ, khởi động job nhanh hơn và các mô hình thực thi cải tiến.
- 目次
- Who Am I?
- Who Are You?
- What Should We Optimize?
- Pig Deployment
- Pig Guts (i.e. Pig Architecture), p. 1
- Pig Guts, p. 2
- Pig Guts, p. 3
- It would be really cool if…
- Memory
- Reducing Spills to Disk
- Skew
- Reducing your Reducers
- (De)serialization
- Faster Job Startup
- Improved Execution Models
- Code Generation
- Learn More
- Questions?
- ページ数
- 19 ページ
- アップロード者
- Uni24h
コメント (0)
まだコメントはありません。最初のコメントを書きましょう!
Stream (11) (Xử lý luồng dữ liệu) - Julian M. Kunkel
Krone (09) (Sự phát triển của dữ liệu) (Tiếng Anh)
Parallel mf (09) (Thuật toán phân tán phân tích ma trận dữ liệu lớn)
Big Data Analytics - Phân tích dữ liệu lớn (Lecture 5)
NoSQL db (06) (Cơ sở dữ liệu NoSQL)
Tổng hợp Đề Toán 5 - Luyện thi vào Lớp 6 - CLB EMath
Bài giảng vật lý đại cương (Chương 3) - Đỗ Ngọc Uấn
Chương 8.Nguyên tử - Vật lý đại cương 3 - TS.Nguyễn Thị Trang
Chương 7.Cơ học lượng tử - Vật lý đại cương 3 - TS.Nguyễn Thị Trang
Chương 6.Quang học lượng tử - Vật lý đại cương 3 - TS.Nguyễn Thị Trang

コメント (0)
まだコメントはありません。最初のコメントを書きましょう!