整理如下:
第零步:检查Python和pip版本,Python版本为2.7.13,pip版本为9.0.1,如诺不够需要升级,如果没法升级可能需要升级系统
python需要安装的库有:
sudo pip install numpy scipy pandas scikit-learn matplotlib seaborn wordcloud jupyter
第一步:安装java环境
sudo add-apt-repository ppa:webupd8team/java
sudo apt-get update
sudo apt-get install oracle-java8-installer
第二步:安装Scala
sudo apt-get install scala
第三步:安装maven
sudo apt-get install maven
第四步:下载Hadoop,Hadoop版本2.7.3 Bxx版本,就是下载名称 没有 src 的那种
第四点五步:将 hadoop/lib/native/ 下的.so文件复制到 /usr/lib/jvm/java-8-oracle/jre/lib/amd64 目录下
第五步:下载spark,版本为1.6.1 Hadoop2.6
第六步:下载bigdl
git clone https://github.com/intel-analytics/BigDL.git
cd ./BigDL
bash make-dist.sh
第七步:配置环境变量
在/etc/profile下配置 或者是 ~/.bashrc
export SPARK_HOME=/usr/local/spark/spark-1.6.1-bin-hadoop2.6
export PATH=${SPARK_HOME}/bin:$PATH
export JAVA_HOME=/usr/lib/jvm/java-8-oracle
export JRE_HOME={JAVA_HOME}/jre
export CLASSPATH=${JAVA_HOME}/lib:${JRE_HOME}/lib
export PATH=${JAVA_HOME}/bin:$PATH
export SCALA_HOME=/usr/share/scala
export PATH=$PATH:$SCALA_HOME/bin
export HADOOP_HOME=/home/fahai/hadoop-2.7.3/
export PATH="$HADOOP_HOME/bin:$HADOOP_HOME/sbin:$PATH"
export HADOOP_OPTS="-Djava.library.path=$HADOOP_HOME/lib/native:$HADOOP_COMMON_LIB_NATIVE_DIR"
export PYTHONPATH=${SPARK_HOME}/python/lib/py4j-0.10.4-src.zip:$PYTHONPATH
修改完之后 source /etc/profile 或source ~/.bashrc
有可能需要重启配置才生效
注:spark我的放在/usr/local/spark/spark-1.6.1-bin-hadoop2.6
java如果是命令行安装的按照我上面的就行
scala也是,如果命令行安装的按上面就行
Hadoop路径/home/fahai/hadoop-2.7.3/
大概就这些
提取跑demo的命令写成sh文件大概是
BigDL_HOME=/home/fahai/BigDL
PATH_TO_CODE=/home/fahai/桌面/
PYTHON_API_PATH=${BigDL_HOME}/dist/lib/bigdl-0.2.0-SNAPSHOT-python-api.zip
BigDL_JAR_PATH=${BigDL_HOME}/dist/lib/bigdl-0.2.0-SNAPSHOT-jar-with-dependencies.jar
export PYTHONPATH=${PYTHON_API_PATH}:$PYTHONPATH
export PYSPARK_DRIVER_PYTHON=jupyter
export PYSPARK_DRIVER_PYTHON_OPTS="notebook --notebook-dir=./ --ip=* --no-browser"
MASTER=local[4]
${SPARK_HOME}/bin/pyspark \
--master ${MASTER} \
--properties-file ${BigDL_HOME}/dist/conf/spark-bigdl.conf \
--driver-memory 8g \
--driver-cores 4 \
--executor-memory 8g \
--total-executor-cores 4 \
--executor-cores 4 \
--py-files ${PYTHON_API_PATH},${PATH_TO_CODE}/PAC_sentiment_example/src/model.py \
--jars ${BigDL_JAR_PATH} \
--conf spark.driver.extraClassPath=${BigDL_JAR_PATH} \
--conf spark.driver.maxResultSize=8g \
--conf spark.driver.memory=6g\
--conf spark.executor.extraClassPath=bigdl-0.2.0-SNAPSHOT-jar-with-dependencies.jar
之后直接 bash demo.sh