《Hadoop 常用命令与 MapReduce 入门》

《Hadoop 常用命令与 MapReduce 入门》

本文整理 hadoop fs 常用命令,并给出一个通过 Spark 读取 HDFS 文件做词频统计的入门示例。

1 hadoop fs 常用命令

# 创建目录 hadoop fs -mkdir /data # 将本地文件上传到 HDFS hadoop fs -put ./README.txt /data # 查看目录内容 hadoop fs -ls /data # 查看文件内容 hadoop fs -cat /data/README.txt # 下载到本地 hadoop fs -get /data/README.txt ./ # 删除文件/目录 hadoop fs -rm /data/README.txt hadoop fs -rm -r /data

2 MapReduce 入门资源

3 通过 Spark 对 HDFS 文件做单词统计

以 Scala 为例,在 Spark 中读取 HDFS 上的文件并联计算词频:

val file = sc.textFile("hdfs://localhost:9000/data/README.txt") val count = file.flatMap(line => line.split(" ")).map(word => (word, 1)).reduceByKey(_ + _) val res = count.collect()

要点:

  • URL 中的 localhost:9000 需与 core-site.xml 中 fs.default.name 配置一致。
  • flatMap 先将每一行按空格切分成单词序列,再 map 生成 (word, 1),最后由 reduceByKey 聚合得到每个单词出现的次数。
阅读 — · 全站 —
🎸 我的歌单 0 首