达观杯文本智能处理挑战赛

创建时间：2018-10-19 投稿人：浏览次数：713

笔者尝试了一下达观杯的比赛，代码如下图所示：

import pandas as pd

import imp

from sklearn.linear_model import LogisticRegression

from sklearn.feature_extraction.text import CountVectorizer

df_test = pd.read_csv(r"testset.csv")

df_train = pd.read_csv(r"trainset.csv")

df_train.drop(columns=["article","id"],inplace=True)

df_test.drop(columns=["article"],inplace=True)

vectorizer = CountVectorizer(ngram_range=(1, 2),min_df=3,max_df=0.9,max_features=10000)

vectorizer.fit(df_train["word_seg"])

x_train =vectorizer.transform(df_train["word_seg"])

x_test =vectorizer.transform(df_test["word_seg"])

y_train =df_train["class"]-1

lg = LogisticRegression(C=4,dual=True)

lg.fit(x_train,y_train)

y_test = lg.predict(x_test)

df_test["class"] = y_test.tolist()

df_test["class"] = df_test["class"] + 1

df_result =df_test.loc[:,["id","class"]]

df_result.to_csv("./result.csv",index=False)

print("完成")

运行结果是：

pandas.errors.ParserError: Error tokenizing data. C error: out of memory

这是因为我的电脑内存太小，导致了内存溢出，因此换一台电脑就可以得到最终得分为72分的答案了。笔者最终排名位于全国前300名，算是一个个人感觉还不错的成绩了。
---------------------

声明：该文观点仅代表作者本人，牛骨文系教育信息发布平台，牛骨文仅提供信息存储空间服务。

热门文章: CTF writeup 2_南邮网络攻防训...; SSM框架——详细整合教程（...; Linux Shell脚本编程－－curl命...; HttpClient使用详解; Java面试题全集（上）; JAVA设计模式之单例模式; java.lang.OutOfMemoryError: PermGen ...; TCP协议中的三次握手和四次...; form表单的两种提交方式，su...; String,StringBuffer与StringBuilder...

最新文章: Java之品优购课程讲义_day20（7）; 剑指 Offer - 8：跳台阶; Netty权威指南_札记02_NIO编程; mysql时间属性之时间戳和datetime之...; 虚拟现实或许可以拯救古埃及的“...; spring cloud服务注册中心eureka---集群...; Java SE 第六章; HTTP请求+数据库; HIDL学习笔记之HIDL C++（第二天）; ubuntu系统下指定tomcat运行时为JDK1.8...