JupyterNotebook调试spark
·
- 下载 spark
- 下载 hadoop
- 下载 winutils.exe 放在 hadoop_home/bin
- 配置环境变量
将spark /jars 下的 py4j-0.10.7.jar 解压到python环境Lib\site-packages下
pip install pypiwin32


- 启动spark
import os
import sys
spark_home = os.environ.get('SPARK_HOME', None)
if not spark_home:
raise ValueError('SPARK_HOME environment variable is not set')
sys.path.insert(0, os.path.join(spark_home, 'python'))
sys.path.insert(0, os.path.join(spark_home, 'python/lib/py4j-0.10.4-src.zip'))
comm=os.path.join(spark_home, 'python/lib/py4j-0.10.4-src.zip')
print ('start spark....',comm)
exec(open(os.path.join(spark_home, 'python/pyspark/shell.py')).read())
更多推荐

所有评论(0)