顯示具有 hadoop 標籤的文章。 顯示所有文章
顯示具有 hadoop 標籤的文章。 顯示所有文章

2017/8/11

Hadoop 練習筆記 - HDFS(multi mode) (1)

參考網址
參考網址
  • 目標 : 建立 Hadoop 實現分散式環境
  • 準備 : CentOS 7  * 3  
    • 1 master , 2 slave
  • 在master主機 /etc/hosts 設定三台domain
    • 192.168.100.100 master
    • 192.168.100.101 slave1
    • 192.168.100.102 slave2
  • 建立hadoop帳號密碼 , 在master主機建立ssh-key鑰  參考網址  , 參考網址
    • useradd hadoop
    • passwd hadoop
    • su hadoop
    • ssh-keygen
    • ssh-copy-id hadoop@192.168.100.101/102
    • 測試無密碼 ssh連線
  • 將hadoop 設為最高權限 (可執行所有指令) 
    • root -> visudo
    • 加入此行  " hadoop  ALL=(ALL)       ALL "
  • 安裝Oracle jdk, 移除open jdk 參考網址 
    • 至官方下載最新jdk
    • su -
    • 安裝rpm yum install jdk-8u51-linux-x64.rpm
    • 變更預設jdk
      • alternatives  --config java
      • 如果未出現選項先update
        • update-alternatives --install /usr/bin/java java /usr/java/jdk1.7.0_79/bin/java 300
    • 移除openjdk 
      • rpm -qa | grep openjdk
      • yum remove -y  [套件名稱]
    • 建立JAVA_HOME
      • nano /etc/profile
      • export JAVA_HOME=/usr/java/jdk1.8.0_141
      • source /etc/profile
      • env | grep java
  • 至官網下載hadoop 安裝檔 2.8.1放置在 /home/hadoop下
  • 配置XML
    • core-site.xml (是核心配置,為 hadoop 指定基本配置信息)
    • hdfs-site.xml  (配置hdfs参数,比如備份數量)
    • mapred-site.xml (配置map-reduce属性)
      • 已改由yarn取代
    • yarn-site.xml (配置yarn属性)
  • Master主機 
    • HDFS設定
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/hdfs-site.xml 


    • 核心的主機交換資料位址設定
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/core-site.xml 

    • 使用 yarn 管理 MR
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/mapred-site.xml

    • yarn-site 的資源管理員設定
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/yarn-site.xml 

    • 環境變數
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/hadoop-env.sh
      • export JAVA_HOME=/usr/java/latest
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/yarn-env.sh
      • export JAVA_HOME=/usr/java/latest
  • Slave主機
    • yarn-site 設定
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/yarn-site.xml 

    •  mapred 由 yarn 管理
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/mapred-site.xml

    • HDFS 設定
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/hdfs-site.xml

    • 核心主機
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/core-site.xml 

  • 添加環境變數
    • source .bash_profile

  • 格式化 hdfs 檔案系統
    • master
      • rm -rf /home/hadoop/namenode
      • mkdir /home/hadoop/namenode
      • 格式化namenode資料夾
        • hdfs namenode -format
    • slave
      • rm -rf /home/hadoop/datanode
      • mkdir /home/hadoop/datanode
  • 設定Node
    • master
      • nano /home/hadoop/hadoop-2.8.1/etc/hadoop/slaves     
      • 加入 slave1 slave2
  • 啟動hadoop
    • cd /home/hadoop/hadoop-2.8.1/sbin/start-all.sh
  • 驗證
    • master觀看 HDFS 驗證
      • hdfs dfs -mkdir /home
      • hdfs dfs -ls /
    • master使用 dfsadmin 觀看報表
      • hdfs dfsadmin -report
    • master使用jps查看進程
      • 應有 NameNode , SecondaryNameNode , Jps , ResourceManager
    • slave使用jps查看進程
      • 應有NodeManager , DataNode , Jps
    • master查看瀏覽器管理介面
      • http://localhost:50070
  • 啟動後查看管理介面
    • http://localhost:50070/ – web UI of the NameNode daemon
    • http://localhost:50030/ – web UI of the JobTracker daemon
    • http://localhost:50060/ – web UI of the TaskTracker daemon




2016/4/25

初學者建立hadoop 分享 (下)



  • 環境安置完畢後, 啟動Ambari

    • 每次安裝前需先將THP關閉, 請參考上篇
    • 啟動ambari
      ambari-server start

    • 打開firefox在url輸入 http://master:8080進入ambari web管理介面



    • 輸入預設管理者帳號 admin  密碼 admin 即可登入

                 


  • 安裝hadoop
    • 安裝

                     


    • 輸入名稱 myhadoop       

                          

    • 選擇hadoop 2.3 版       
                   
    • 因為此範例cluster只有一台主機 , 因此輸入master , 並且給予ssh 私鑰 , 透過指令產生私鑰,並將畫面上的結果貼上 (記得使用root權限)
                     cat ~/.ssh/id_rsa
                     
                      



    • 選擇服務 , 順利的話一路下一步至選擇服務, 這裡我選的是HDFS、MapReduce、Yarn、Tez、Hive、Pig、Oozie、Zookeeper、Ambari Metrics、HBase、Sqoop

                      


    • 一路下一步, 這裡有兩個錯誤, 需要輸入資料庫密碼, 自訂即可

    • 安裝如果中斷, 不斷re-run即可
    • 安裝完畢後, 如果左方有error 可試著重啟 , 或著照著 官網 解決方法
    • 如需要重啟ambari , 建議先將安全模式關閉 , 才能真正讓設定生效
      • su - hdfs
      • hadoop dfsadmin -safemode leave







    2016/4/24

    初學者建立hadoop 分享 (上)


    • 環境介紹

      • vmware 12
      • centos 6.6
      • jdk 7
      • hortonwork & ambari
      • hdp 2.3.0
      • name node、data node、secondary name node 皆在同一台vm ( 參考 )

    • 事前準備

    • vmware安裝centos

      • 安裝時請設定記憶體與容量大小,安裝完畢的畫面
      • 安裝時請不要新增hadoop帳號,以免安裝hadoop時無法順利進行


    • 設定一組ssh公私鑰

      • 在終端機切換到root 
                         su - 
      • 產生ssh公私鑰
                        ssh-keygen
      • 複製公鑰給自己
                         cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
      • 測試 ssh
                        ssh localhost

    • 設定hostname

      • 檢查本機ip (192.168.186.206)
                         ifconfig

      • 編輯hosts , 加入 master ip (192.168.186.206)
                        nano /etc/hosts


                         hostname master
      • 檢查hostname
                         hostname -f

    • 設定/啟動對時服務

      • 因hadoop屬分散式架構需開啟
                        chkconfig ntpd on
                        service ntpd start

    • 安裝JDK

      • 可直接利用linux的firefox上網下載,或者如果你的使用環境是windows的話,可以開啟samba服務做資料交換
      • 下載   jdk-7u79-linux-x64.rpm
      • 安裝 rpm
                          rpm -ivh jdk-7u79-linux-x64.rpm
      • 為了未來切換版本方便, 建立軟連結, 類似windows的捷徑
                         ln  -s /usr/java/jdk1.7.0_79 /usr/java/java

      • 檢查軟連結
                       ll /usr/java/java

      • 設定環境變數, 在啟動腳本最下方加入4行export
                       nano /etc/profile
        • export JAVA_HOME=/usr/java/java
        • export JRE_HOME=$JAVA_HOME/jre
        • export CLASSPATH=.:$JAVA_HOME/lib/dt.jar:$JAVA_HOME/lib/tools.jar:$JRE_HOME/lib/rt.jar
        • export PATH=$PATH:$JAVA_HOME/bin
                                  

      • 立即重啟 / 立即生效
               source /etc/profile
      • 檢查
               java -version

    • 關閉安全設定

      • 為保持hadoop暢通 , 關閉其機制
      • 關閉防火牆
               chkconfig iptables off
               service iptables stop
      • 關閉linux安全機制
               nano /etc/selinux/config 將 SELINUX=disabled
               setenforce 0 (強制關閉) 

    • 關閉THP (Transparent Huge Pages)

      • 官方建議THP , 避免因記憶體影響導致重開機
                       echo never > /sys/kernel/mm/redhat_transparent_hugepage/enabled
                       echo never > /sys/kernel/mm/redhat_transparent_hugepage/defrag

    • 安裝Ambari

      • 透過ambari的圖形化介面安裝hadoop
      • 下載 ambari-server-2.2.0.0-1310.x86_64.rpm
      • 安裝ambari
                        yum localinstall ambari-server-2.2.0.0-1310.x86_64.rpm
                        ambari-server setup



            

    • 總結 再來下集部分要透過ambari的圖形化介面幫我們完成hadoop安裝



    test2