jieba英文空格分词问题

发布于
2018-08-14

1.对于关键词存在空格或者特殊符号的情况下，jieba无法分出该词

2.在github上找到了一个解决方案，修改jieba源码
__init__.py
免费分享，造损免责。
打开默认词典（根目录）或自定义词典，把所有用来间隔词频和词性的空格间隔符改成@@
（选用@@是因为一般关键词里遇到这个分隔符的几率比较小吧）

继续，打开jieba根目录下init.py

搜索
re_han_default = re.compile("([\u4E00-\u9FD5a-zA-Z0-9+#&\._]+)", re.U)
改成
re_han_default = re.compile("(.+)", re.U)

搜索
re_userdict = re.compile('^(.+?)( [0-9]+)?( [a-z]+)?$', re.U)
改成
re_userdict = re.compile('^(.+?)(\u0040\u0040[0-9]+)?(\u0040\u0040[a-z]+)?$', re.U)

搜索
word, freq = line.split(' ')[:2]
改成
word, freq = line.split('\u0040\u0040')[:2]

补充：若用的全模式继续改。
搜索
re_han_cut_all = re.compile("([\u4E00-\u9FD5]+)", re.U)
改成
re_han_cut_all = re.compile("(.+)", re.U)

但是这样导致分词的结果出现大量的emoji表情或者不需要的类似 =，（）的符号,

3.期望输出

我 只想让jieba能够识别自定义词中存在空格的中英文关键词或者以 -连接的关键词并且去除其他特殊字符比如emoji等表情符 该怎么修改呢?

string = 'my dog is a happy dog'
jieba.add_word('happy dog')

jieba.cut(my dog is a happy dog)

outputs: ['my','dog','is','a','happy','dog']

期望输出: ['my','dog','is','a','happy dog']

对正则表达式实在头大，希望有经验的大佬能告诉我有什么办法...

python jieba分词

阅读 20.5k

2 个回答

只需要往相应的正则表达式添加空格即可，如

-re_han_default = re.compile("([\u4E00-\u9FD5a-zA-Z0-9+#&\._%]+)", re.U)
+re_han_default = re.compile("([\u4E00-\u9FD5a-zA-Z0-9+#&\._% ]+)", re.U)

示例

In [1]: import re

In [2]: import jieba

In [3]: s = 'my dog is a happy dog'

In [4]: list(jieba.cut(s))
Out[4]: ['my', ' ', 'dog', ' ', 'is', ' ', 'a', ' ', 'happy', ' ', 'dog']

In [5]: jieba.re_han_default = re.compile("([\u4E00-\u9FD5a-zA-Z0-9+#&\._% ]+)", re.U)

In [6]: jieba.add_word('happy dog')

In [7]: list(jieba.cut(s))
Out[7]: ['my', ' ', 'dog', ' ', 'is', ' ', 'a', ' ', 'happy dog']

Leo黎诗霆

4168

发布于
2018-08-15

英文的话还是可以考虑nltk。你可以试一下MWETokenizer

import nltk
tokenized_string = nltk.word_tokenize("my dog is a happy dog")
mwe = [('happy', 'dog')] # 添加这个短语(phrase)
mwe_tokenizer = nltk.tokenize.MWETokenizer(mwe)
result = mwe_tokenizer.tokenize(tokenized_string)

jibe如果有解决方案望补充。

撰写回答

你尚未登录，登录后可以

和开发者交流问题的细节
关注并接收问题和回答的更新提醒
参与内容的编辑和改进，让解决方法与时俱进

推荐问题

jieba英文空格分词问题

你尚未登录，登录后可以

字节的 trae AI IDE 不支持类似 vscode 的 ssh remote 远程开发怎么办？

DataCap 中验证码无法显示，后台出现 NullPointerException 错误?

发现深拷贝和浅拷贝效果一致：请问一下有什么区别呢？

如何实现一个深拷贝函数？

Python 成员变量在多个子类实例间共享，如何避免？

为什么 Qwen2.5-Omni-7B 官方教程都报错 Cannot import available module of Qwen2_5OmniModel in modelscope ？

Spark-TTS-0.5B 的 requirements.txt 在哪里？