1. 下载 spark
  2. 下载 hadoop
  3. 下载 winutils.exe 放在 hadoop_home/bin
  4. 配置环境变量

将spark /jars 下的 py4j-0.10.7.jar 解压到python环境Lib\site-packages下

pip install pypiwin32

image

image

  • 启动spark
import os
import sys

spark_home = os.environ.get('SPARK_HOME', None)
if not spark_home:
    raise ValueError('SPARK_HOME environment variable is not set')
sys.path.insert(0, os.path.join(spark_home, 'python'))
sys.path.insert(0, os.path.join(spark_home, 'python/lib/py4j-0.10.4-src.zip'))
comm=os.path.join(spark_home, 'python/lib/py4j-0.10.4-src.zip')
print ('start spark....',comm)
exec(open(os.path.join(spark_home, 'python/pyspark/shell.py')).read())
Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐