社区应用 最新帖子 社区服务 会员列表 统计排行 搜索 银行
  • 1022阅读
  • 0回复

写宋词其实这么简单

楼层直达
级别: 骑士
  一位学习统计学的网友,利用所学将《全宋词》中出现的99个“高频词汇”统计出来,发在博客上。没想到,这篇博文很快就被大量转载,并有网友利用这些高频词汇重新“写词”。圆周率、生日、身份证号码都可以组成一首形式上的“宋词”。 MW &iNioX  
Ia*eb%HG  
  在江汉大学刚刚举办的“诗词吟诵暨诗歌大赛颁奖会”上,不少学生讨论这个话题。真的存在网友说的“自动写词机”吗?记者展开采访调查。 T+8F'9i`  
t \kI( G  
  《全宋词》中的99个高频词汇 | y\B*P  
7[[XNJP  
  话题的“始作俑者”是一位学习统计学的研究生,网名“yixuan”,他在博客上发表一篇文章:“突然想看看宋词里面什么样的意象是最常见的,比如可以做个频率分析什么的。当然文本挖掘需要分词,我没法在其中花太多时间,于是想出了一个土办法。” M~t S *  
N1jj\.nB  
  宋词的句子都很短,最常见的词语一般是两三个字,这样可能的组合就更少了。比如“犹解嫁东风”这句话,可能的二字组合是“犹解”“解嫁”“嫁东”“东风”,三字组合是“犹解嫁”“解嫁东”“嫁东风”,词的字数越多,可能的组合就越少。 3+;]dqZ  
?_3K]i1IS  
  “yixuan ”统计出99个《全宋词》中的高频词汇。排在前面的依次为“东风(1382次)、何处(1230次)、人间(1202次)、风流(857次) 、归去(812次、)春风(802次)、西风(779次)、归来(771次)、江南(765次)。 f>g>7OsD]  
>j{phZ  
  “yixuan ”的这篇博文一发出来,很快就被另外一家网站转载,大量网友被这个有趣的话题吸引,纷纷发帖评论。 ~Y<x-)R  
U< |kA(5  
  高频词汇被演绎成“自动写词机” B8NOPbT  
H1N_  
  在大量评论后面,一位名叫“达芬奇的鸡蛋”发现,利用这些“高频词汇”的代码,可以随意拼凑出一首首宋词来。比如用“圆周率”的数字排序,结果就是:回首明月(一看就是抒情诗) zjs@7LN  
 =P\H}?PF  
  悠悠心事空 eNY$N_P   
8QV+DDZx  
  西湖何事寂寞中 yHT8I  
&]iX>m.  
  风吹斜阳匆匆 `PnB<rf:*1  
{<5rbsqk  
  芳草平生斜阳 #>g]CRN  
r4D*$H-rR  
  风吹寂寞今日  s de|t  
d\WnuQR[  
  一枝富贵年年 xV @X%E  
$/ew'h9q  
  断肠长安不知 JeU|e$I4>  
/PN[g~3  
  一时间,众多网友用自己的身份证号码、各种数字组合来“写宋词”。如网友“叶绿彘”的“作品”是:“东风何处?人间风流。归去春风,西风归来。江南相思,梅花千里。回首明月,多少如今?阑干年年万里,一笑黄昏当年……” /!rH DcR  
0&E{[~Pv  
  记者用多位同事的身份证号码、生日号码等,套用这些代码,果然也能产生出一首首有模有样的“宋词”。 W]{mEB  
MYFRrcu;  
  原意不是为了“写词” 7 [N1Vr(1  
\74+ cN  
  看到帖子被大量转发,“yixuan ”在自己的博客上又写了一篇解释,他说,“自动写词机”并不是我的创意,也不是我的初衷。 @{\q1J>  
 ~,Ck  
  “yixuan ”说:“我学的专业是统计和精算,平时会和各种类型的数据打交道,之前写那篇博文也是出于兴趣,想利用学到的专业知识来对一些实际问题进行分析。” YIGQDj@  
23 BzD^2a  
  他说,很多人肯定都会提到“自动写词机”,就比如拿生日、QQ、物理常数等套用里面的排序来“写词”。但我想说的是,这其实不是我的创意,也不是我写那篇博文的初衷。如果大家看过那篇转帖,就会发现大家开始“狂欢”是因为“达芬奇的鸡蛋”的创意,而词频统计本身并没有任何特殊之处。 V4ml& D  
T B~C4HK=  
  事实上,大家可能听说过“文本挖掘”这个名词,它就是对文本数据进行分析,来得到有用的结论。文本挖掘是个很复杂的过程,牵涉到分词、词频统计、特征选择、聚类等等,如果大家对这一块内容有所了解的话,就会知道词频统计是一个很平凡的过程。 vG`R.  
{]]qd!,  
  “yixuan”说:可能有些朋友觉得我得到宋词的词频是一件技术含量很高的活儿,但从技术层面上来讲,我做的那些东西也并无任何高级之处(当然需要有一些编程经验)。 8Ih+^Y a  
M^DYzJ  
  只是一个文字游戏 Wg9q_Ql  
k;/U6,LQ*  
  这99个“高频”词汇真的有那么神奇?昨天,武汉大学文学院博导王兆鹏教授看了后评论说:“这只是一个文字游戏”。 P#]%C  
z)I.^  
  王兆鹏说,汉语语言中,诗词的语序不需要确定性,同时汉语语言具有多义性。很多词语组合起来,都可以说得通。比如我们说“吃饭”大家能听懂,但说“饭吃”,也能理解是怎么回事。 RZi]0l_A'  
E+k#1c|v$  
  从严格意义上说,通过这99个编码做成的“词”,平仄完全不符合要求,也不符合词牌的要求。但形式上挑不出什么毛病,也有一点词的味道。 422d4Zu  
NCbn<ojb  
  王兆鹏说,宋词是一种文学艺术,讲究独创性和意境,读者通过读诗词能够看到里面的意境,这是艺术。“如果写词这么容易,那谁都可以写词了。” DyIuM{Owj  
RI9&KS  
  不过,王兆鹏也认为“yixuan ”的做法很有创意,“能从这么多词中总结出99个高频词汇,是需要花功夫的,也说明这个学生很努力,这是一个比较高级的文字游戏,虽然谈不上有什么文学意义。” UM%]A'h2O"  
. S4Xw2MS  
  中南财经政法大学统计与数学学院博导李占风教授说,利用统计学原理确实可以在诗词等文学作品中,做一些研究工作,这位学生学以致用,值得表扬。 m?VA 1  
快速回复

限150 字节
如果您提交过一次失败了,可以用”恢复数据”来恢复帖子内容
 
上一个 下一个