![Python自然语言处理(微课版)](https://wfqqreader-1252317822.image.myqcloud.com/cover/869/44509869/b_44509869.jpg)
上QQ阅读APP看书,第一时间看更新
1.5.5 搜狗新闻语料库
搜狗新闻语料库,下载地址为http://www.sogou.com/labs/resource/cs.php,如图1-14所示。
搜狐新闻数据(SogouCS)请直接下载精简版,文件为SogouCS.reduced.tar.gz,解压到d:\SogouCS.reduced,共有128个文本文件,如图1-15所示。
每一个txt文件采用ANSI编码,内容是XML格式化,如图1-16所示。
将每个txt文件根据url、contenttitle、content进行拆分,具体含义如下。
· url:获取内容类别。
· contenttitle:获取内容标题,作为txt的文档名。
· content:正文内容。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P31_2511.jpg?sign=1739679797-aTiqN4EO6RbBG7FLeJAhXRvMMTPVJX0y-0-12cb4f1b737ce078a5aff08aba4f765a)
图1-14 搜狗新闻语料库网页
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P31_2514.jpg?sign=1739679797-i8bEbzlEltzStloNTLfqAONuDTBHf1Il-0-6c780755b3336642c8655c1178ca7222)
图1-15 下载搜狗新闻语料库
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P32_2519.jpg?sign=1739679797-pMcWQIycOvtl2RYSeHhscKhxXbFpjSMQ-0-1d0ac02c910b09567b6facb56b7205e8)
图1-16 文件内容
代码如下。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P32_2522.jpg?sign=1739679797-SlvxKEfu7f0YuxebiCES9MlZ6fNngdZP-0-4de9c9086c359b271f599f16159444af)
最终数据集整理为15个类别,如图1-17所示。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P33_2527.jpg?sign=1739679797-3UvUwmAhjJT2bItj9ryMWfke5m08jrSX-0-3fbeabfda285a6d4baa989d90ff8f5a6)
图1-17 语料集分类