安装jieba库

在Python中安装jieba库可以通过pip命令完成。确保已安装Python和pip工具后,在命令行或终端输入以下命令:

pip install jieba

对于国内用户,若下载速度较慢,可以使用国内镜像源加速安装。例如使用清华镜像源:

pip install jieba -i https://pypi.tuna.tsinghua.edu.cn/simple

基本分词功能

jieba库的核心功能是中文分词。以下是一个简单的分词示例:

import jieba

text = "我爱自然语言处理"
seg_list = jieba.cut(text, cut_all=False)
print(" ".join(seg_list))  # 输出: 我 爱 自然语言处理

支持三种分词模式:

  • 精确模式(默认):jieba.cut(text, cut_all=False)
  • 全模式:jieba.cut(text, cut_all=True) 会输出所有可能组合
  • 搜索引擎模式:jieba.cut_for_search(text) 适合搜索引擎建立索引

添加自定义词典

当默认词典无法满足需求时,可以添加自定义词典:

jieba.load_userdict("userdict.txt")  # 文件路径

词典格式为每行一个词,包含词频和词性(可选):

云计算 5 n
区块链 3 n

临时添加单个词语:

jieba.add_word("深度学习", freq=20, tag="n")

关键词提取

基于TF-IDF算法的关键词提取:

from jieba import analyse

text = "机器学习是人工智能的重要分支"
keywords = analyse.extract_tags(text, topK=5)
print(keywords)  # 输出: ['机器学习', '人工智能', '分支', '重要']

设置停用词表:

analyse.set_stop_words("stop_words.txt")

词性标注

获取分词结果的同时标注词性:

import jieba.posseg as pseg

words = pseg.cut("北京大学是中国著名大学")
for word, flag in words:
    print(f"{word} {flag}")

常见词性标记:

  • n:名词
  • v:动词
  • a:形容词
  • nr:人名
  • ns:地名

并行分词

启用并行分词模式提升大文本处理速度:

jieba.enable_parallel(4)  # 参数为并行进程数

关闭并行模式:

jieba.disable_parallel()

其他实用功能

获取词语在词典中的词频:

freq = jieba.get_FREQ("人工智能")

调整词典中词语的词频:

jieba.suggest_freq(("自然语言", "处理"), tune=True)

处理繁体中文文本:

text = "繁體中文處理"
seg_list = jieba.cut(text)

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐