python安装jieba库及其使
·
安装jieba库
在Python中安装jieba库可以通过pip命令完成。确保已安装Python和pip工具后,在命令行或终端输入以下命令:
pip install jieba
对于国内用户,若下载速度较慢,可以使用国内镜像源加速安装。例如使用清华镜像源:
pip install jieba -i https://pypi.tuna.tsinghua.edu.cn/simple
基本分词功能
jieba库的核心功能是中文分词。以下是一个简单的分词示例:
import jieba
text = "我爱自然语言处理"
seg_list = jieba.cut(text, cut_all=False)
print(" ".join(seg_list)) # 输出: 我 爱 自然语言处理
支持三种分词模式:
- 精确模式(默认):
jieba.cut(text, cut_all=False) - 全模式:
jieba.cut(text, cut_all=True)会输出所有可能组合 - 搜索引擎模式:
jieba.cut_for_search(text)适合搜索引擎建立索引
添加自定义词典
当默认词典无法满足需求时,可以添加自定义词典:
jieba.load_userdict("userdict.txt") # 文件路径
词典格式为每行一个词,包含词频和词性(可选):
云计算 5 n
区块链 3 n
临时添加单个词语:
jieba.add_word("深度学习", freq=20, tag="n")
关键词提取
基于TF-IDF算法的关键词提取:
from jieba import analyse
text = "机器学习是人工智能的重要分支"
keywords = analyse.extract_tags(text, topK=5)
print(keywords) # 输出: ['机器学习', '人工智能', '分支', '重要']
设置停用词表:
analyse.set_stop_words("stop_words.txt")
词性标注
获取分词结果的同时标注词性:
import jieba.posseg as pseg
words = pseg.cut("北京大学是中国著名大学")
for word, flag in words:
print(f"{word} {flag}")
常见词性标记:
- n:名词
- v:动词
- a:形容词
- nr:人名
- ns:地名
并行分词
启用并行分词模式提升大文本处理速度:
jieba.enable_parallel(4) # 参数为并行进程数
关闭并行模式:
jieba.disable_parallel()
其他实用功能
获取词语在词典中的词频:
freq = jieba.get_FREQ("人工智能")
调整词典中词语的词频:
jieba.suggest_freq(("自然语言", "处理"), tune=True)
处理繁体中文文本:
text = "繁體中文處理"
seg_list = jieba.cut(text)
更多推荐
所有评论(0)