国产在线精品一区二区三区,特级做a爰片毛片免费69

Python進(jìn)行網(wǎng)頁(yè)文本處理。

網(wǎng)頁(yè)文本中的中英文處理的區(qū)別在于中文需要額外加入分詞處理過(guò)程。所謂分詞就是將一段文本文字分成一個(gè)個(gè)詞組的過(guò)程。

具體處理流程為:加載jieba分詞包進(jìn)行中文分詞;將分詞后的詞組去掉停用詞及一個(gè)字符的詞后, 輸出訓(xùn)練文本中的常用分詞和熟悉的詞組;在訓(xùn)練文本的數(shù)據(jù)訓(xùn)練及情感詞典的歸檔中將爬取獲得的網(wǎng)頁(yè)數(shù)據(jù)的客觀性文本分詞后放入變量中, 主觀類(lèi)情感文本放入另一變量中;為自動(dòng)得到網(wǎng)頁(yè)文本中重要的關(guān)鍵詞組, 過(guò)濾掉對(duì)網(wǎng)頁(yè)文本意義貢獻(xiàn)不大的常用詞組, 在chi2模塊的特征選擇下, 采用詞頻-逆文本頻率 (TF-IDF) 概念將分詞詞組變量轉(zhuǎn)換為tf-idf向量形式, 輸出分詞向量矩陣, 為下一階段的網(wǎng)頁(yè)文本情感分析做準(zhǔn)備。

本文地址：http://jiujiu9.com//article/20623.html

分享到：QQ空間新浪微博騰訊微博人人網(wǎng)微信開(kāi)心網(wǎng)百度貼吧豆瓣網(wǎng)

四川少妇BBB凸凸凸BBB,国产综合在线观看,天美传媒果冻传媒国产日本,国产精品美女一区二区三区

行業(yè)動(dòng)態(tài)Python進(jìn)行網(wǎng)頁(yè)文本處理