MapReduce之輸入輸出類型

原創

2020-02-26 06:19

轉載：http://blog.csdn.net/lucktroy/article/details/7957120

話說用hadoop MapReduce編程有一陣子了，但是關於Mapper, Combiner, Reducer的輸入輸出類型居然花了我一整天。

我本以爲Combiner的輸入與Mapper的輸出一致，Combiner的輸出與Reducer的輸入一致就可以了，就像圖1：

圖1 假想

我的程序Mapper輸出是<Text, DoubleWritable>; Combiner的輸入輸出分別是<Text, DoubleWritable>, <Text, Text>; 然後Reducer的輸入是<Text, Text>.

我本想邏輯上都沒問題，但事與願違，老出錯.

在hadoop中，默認的job.setOutputkeyClass(*.class), job.setOutputValueClass(*.class)是針對Mapper與Reducer的，這裏因爲兩者不同，我試着用job.setMapOutputKeyClass(*.class)與job.setMapOutputValueClass(*.class)區分. 但依然有錯誤.

在幾經周折後，在看完一篇博文“《Data-intensive Text Processing with MapReduce》讀書筆記第3章：MapReduce算法設計(1)”後，發現原來Mapper與Combiner的輸出均要與Reducer對應（見圖2），於是改了過來，終於通過，因爲沒有看過hadoop源碼，所以也不知道它底層具體是如何實現的.

圖2 實際

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

教你用Perl實現Smgp協議

本文分享自華爲雲社區《華爲雲短信服務教你用Perl實現Smgp協議》，作者：張儉。引言&協議概述中國電信短消息網關協議（SMGP）是中國網通爲實現短信業務而制定的一種通信協議，全稱叫做Short Message Gateway Pro

2024-05-06 10:32:43

lightdb操作出錯:ERROR: current transaction is aborted, commands ignored until end of transaction block

前言 lightdb數據庫是恆生自主研發的面向金融領域的支持集中式和分佈式的國產數據庫，實現基於PostgreSQL，因此也會遵循postgreSQL的一些事務特性。本文章主要說明的特性爲：在一個事務中，如果有一個SQL執

2024-05-05 21:55:25

Java中的4種線程池

Java 裏面線程池的頂級接口是 Executor，但是嚴格意義上講 Executor 並不是一個線程池，而只是一個執行線程的工具。真正的線程池接口是 ExecutorService。 newCachedThreadPool 創建一個

2024-05-05 21:31:36

Java中線程的創建方式

繼承 Thread 類 Thread 類本質上是實現了 Runnable 接口的一個實例，代表一個線程的實例。啓動線程的唯一方法就是通過 Thread 類的 start()實例方法。 start()方法是一個 native 方法，它將

2024-05-04 21:31:13

Java集合中的Set

Set 有去重的特性，該體系集合用於存儲無序(存入和取出的順序不一定相同)元素，值不能重複。對象的相等性本質是對象hashCode值（java是依據對象的內存地址計算出的此序號）判斷的，如果想要讓兩個不同的對象視爲相等的，就必須覆蓋Obje

2024-05-02 23:34:26

Java中的List

List 是Java中非常常用的數據類型。 List 是有序的 Collection。 Java List 一共三個實現類：分別是 ArrayList、 Vector 和 LinkedList。 ArrayList（數組） Array

2024-05-01 21:31:27

通義靈碼實戰系列：一個新項目如何快速啓動，如何維護遺留系統代碼庫？

作者：別象進入 2024 年，AI 熱度持續上升，翻閱科技區的文章，AI 可謂是軍書十二卷，卷卷有爺名。而麥肯錫最近的研究報告顯示，軟件工程是 AI 影響最大的領域之一，AI 已經成爲了軟件工程的必選項，也有研究稱開發者每天的事務性工作可

2024-04-30 21:12:20

Apache DolphinScheduler支持Flink嗎？

隨着大數據技術的快速發展，很多企業開始將Flink引入到生產環境中，以滿足日益複雜的數據處理需求。而作爲一款企業級的數據調度平臺，Apache DolphinScheduler也跟上了時代步伐，推出了對Flink任務類型的支持。 Flink

2024-04-30 11:49:27

Spring AI 搶先體驗，5 分鐘玩轉 Java AI 應用開發

作者：劉軍 Spring AI 是 Spring 官方社區項目，旨在簡化 Java AI 應用程序開發，讓 Java 開發者像使用 Spring 開發普通應用一樣開發 AI 應用。 Spring Cloud Alibaba AI 以 Spr

2024-04-29 21:12:12

1 名工程師輕鬆管理 20 個工作流，創業企業用 Serverless 讓數據處理流程提效

作者：嶽洋、陳德全、劉靜娜北京語勢科技有限公司成立於 2023 年 6 月，語勢科技定位爲“智能投資時代的主題入口”，在資管行業從以機構爲核心轉向以用戶爲核心的變革時代，通過打造主題投資引擎，賦能普惠投資一體化，打造以投資者和資管機構爲主

2024-04-28 21:12:22

哈哈哈哈或

在Java編程中，簡潔高效的實現往往涉及幾個關鍵原則和技能。例如，使用簡單的代碼結構來提高代碼訪問性和可維護性，這意味着代碼應該追求清晰、簡潔且模式匿名，因爲過度模式匿名會導致複雜度增長，影響代碼的維護性和效率。其中，簡潔高效還包攜

2024-04-28 00:40:41

Java編程工具：簡潔高效實現

Java編程工具：簡潔高效實現Java編程工具：簡潔高效實現Java編程工具：簡潔高效實現

2024-04-27 00:41:09

Java word通過html設置樣式（Spire Docx）

Java word通過html設置樣式（Spire Docx） <dependencies>  <dependency>

2024-04-26 23:42:09

從零開始學架構V2-初識架構設計-1

一、架構設計的主要目的爲了解決軟件系統複雜度帶來的問題二、複雜性來源軟件的架構設計是一個非常複雜的過程；基於業務&技術現狀、公司成本、團隊規模、團隊技術能力、近三年業務發展規模預測、技術發展趨勢等條件篩選出合適的技術、編寫多種架構設計

2024-04-25 23:56:25

高德地圖爬蟲實踐：Java多線程併發處理策略

背景介紹高德地圖是一款基於互聯網和移動互聯網的地圖與導航應用，提供了包括地圖瀏覽、公交查詢、駕車導航、步行導航等在內的多種功能。其龐大的用戶羣體和豐富的地圖數據成爲了各行各業進行位置服務、地理信息分析等應用的首選。爬蟲實踐需求在

2024-04-25 23:26:44

24小時熱門文章

最新文章

最新評論文章