FreeOZ论坛

标题: 如何实现论坛的相关文章搜索功能? [打印本页]

作者: coredump    时间: 13-9-2008 00:29
标题: 如何实现论坛的相关文章搜索功能?
答案是TF/IDF(term frequency/inverse document frequency) 算法,这个也是Google确定网页和查询相关性的所采用的算法。

参考:


1.
Google的TF/IDF算法简介
http://www.googlechinablog.com/2006/06/blog-post_27.html



2.
Javaeye网站的论坛用TF/IDF实现了相关文章推荐功能
http://www.javaeye.com/post/440835

http://robbin.javaeye.com/blog/197526


3.
lucence的TF/IDF算法实现:
http://lucene.apache.org/java/1_9_1/api/org/apache/lucene/search/similar/MoreLikeThis.html

作者: coredump    时间: 13-9-2008 00:32
谁能用这个算法帮大家实现个discuz!论坛的相关文章推荐功能啊,这可是很有趣,很有挑战性哦!
作者: akai    时间: 18-9-2008 15:52
discuz作者有公司 目前都没搞定
牛人如果搞好了 可以开公司了。
中国多少个disucz 社区阿.
作者: decisiontree    时间: 9-10-2008 18:27
我来顶下,其实
http://www.googlechinablog.com/2006/06/blog-post_27.html

Google的TF/IDF算法不难的,关键是中文有特殊性(字词)。英文只有词加少量短语。所以比如搜索"澳大利亚",如果一个一个字的断就完了。两个两个断也不行,只有四个字一起才有意义,但是搜索"澳大利亚法律"又不能一起搜,要把断成"澳大利亚"和“法律"。至于怎么断呵呵商业机密吧。英文没这个问题“australian law",两个词很清楚。
作者: xblues    时间: 9-10-2008 18:39
提示: 作者被禁止或删除, 无法发言 http://zzk.cnblogs.com/default.aspx

博客园的找找看使用了Lucene.NET引擎,那里也有一些讨论分词的信息,他们还在完善找找看。

http://space.cnblogs.com/group/zzk/

@子曰
你好,首先感谢你对ZZK的支持。
我们现在的分词方式很粗糙,在分词操作中使用了三个词库,算法是正向最大匹配,整个分词操作中没有使用词频、词性、语义等信息。
新的分词方式正在设计中,其效果应该会更好。
作者: decisiontree    时间: 9-10-2008 20:52
原帖由 xblues 于 9-10-2008 19:39 发表
http://zzk.cnblogs.com/default.aspx

博客园的找找看使用了Lucene.NET引擎,那里也有一些讨论分词的信息,他们还在完善找找看。

http://space.cnblogs.com/group/zzk/

@子曰
你好,首先感谢你对ZZK的支持 ...



光这个分词就够做一个PHD论文了. 如果要做论坛的相关文章搜索功能,最好用两拨人,一拨做PAGE RANKING, 另一拨专门做中文的SEMENTIC分词.  
作者: coredump    时间: 10-10-2008 11:15
大家讨论的很有趣啊,看来牛人不少,有没有主动请缨的?
作者: xblues    时间: 10-10-2008 11:27
提示: 作者被禁止或删除, 无法发言 标题: 回复 #7 coredump 的帖子
我是冒牌的,看其他人吧。




欢迎光临 FreeOZ论坛 (https://www.freeoz.org/forum/) Powered by Discuz! X3.2