标签归档:推荐系统

RSS feed of 推荐系统

国外典型图书馆推荐系统简介

library-recommender-system

    由于起步较早,目前国外的图书馆信息化程度整体上优于国内,推荐系统也已经开始应用在数字化图书馆领域,为读者提供个性化的图书推荐服务。其中,BibTip,ExLibris bX,Foxtrot,TechLens,Fab和LIBRA是几个比较有代表性的图书馆推荐系统解决方案。

    德国卡尔斯鲁厄大学的BibTip推荐系统从2009年开始作为一项独立的付费服务对用户开放。BibTip是一个基于行为的推荐系统,通过对用户行为的匿名监控与评估提供推荐服务。该系统在服务器上进行推荐的数据分析及管理,图书馆无需过多的技术投入即可使用BibTip的服务。BibTip的体系结构包含3层,自底向上分别为数据层、代理层和用户界面层。BibTip的理论基础是Andrew Ehrenberg提出的重复购买理论,该理论对消费者的行为进行了分析[1]。Ehrenberg证明人们在做出商品支付决定后会重复他们的选择,并且在下一次购物时会倾向于选择同一个品牌。BibTip使用了这一理论。通过用户的初始行为可得出用户的兴趣和喜好。例如,假设某用户对刊物X感兴趣,则该用户很可能对同一作者的刊物Y也感兴趣。BibTip需要大约几个月的时间收集和分析用户的初始行为数据。如果用户的访问频率较高,初始阶段可以缩短一些,但是推荐系统仍然面临着冷启动的问题。由于是基于用户行为的推荐系统,BibTip的适用范围比较广泛。

    ExLibris bX(以下简称bX)从2009年开始为使用SFX(ExLibris的上下文敏感连接服务器,可在学术环境下实现不同Web资源之间的连接)的图书馆用户提供按需式服务。bX基于OpenURL和OAI-PMH标准,这两个标准协议用于对资源和相关元数据进行唯一标识。作为一种基于行为的推荐系统,bX根据对Web会话链接点击的分析生成推荐信息[2]。系统所需的统计数据来源于ExLibris链接解析器的日志文件,所有相关院校的日志文件均可为推荐系统所用。bX在一定程度上解决了传统的基于行为的推荐系统中存在的一些问题,例如它应用了一些虽然简单但是行之有效的方法去除出版物与用户中存在的重复数据。由于系统使用了来自于很多不同高校的日志数据,因此冷启动问题也得到了明显的缓解。但是,如果没有足够的高校日志数据可用时,bX必须先收集到足够的日志信息,然后才可以开始做推荐[3]

    Foxtrot使用一种本体论(研究论文话题本体)来描述用户并以此建立档案。Foxtrot基于相似用户和相似资源生成推荐信息,因此Foxtrot是一个结合了协同过滤与基于内容过滤方法的混合型推荐系统,其用户交互(访问URL,用户反馈)通过Web代理进行记录。包含有热门出版物与日期的可视化档案可以帮助用户理解系统的工作原理。每一篇论文都由规范化条目组成的向量以及诸如日期、题名、分类号、链接和论文URL等元数据进行描述。Foxtrot使用多级分类器IBK对论文进行分类。表示用户兴趣的档案可以通过本体的推理得到增强。Foxtrot同时也为利用相关数据集成外部本体提供了可能性,从而消除了冷启动的问题。

    TechLens最重要的特性是其协同过滤方法关注论文本身的特征[4]。一篇论文隐式地将其引用文献定性为优质论文,后者将被用作推荐使用。用户档案只包含一篇论文(隐式:最后浏览的论文,显式:用户选择的论文)。算法的作者认为该方法可以对当前用户的兴趣进行最优匹配。这种用户档案的优势是无需在用户端设置其他的监控系统,缺点是用户兴趣的演化无法得到跟踪。通过对10种不同的协同过滤,基于内容的过滤以及混合算法的测试,结果表明混合式的Fusion推荐算法表现优于单纯的协同过滤方法。Fusion以并行运行的方式同时使用了协同过滤与基于内容的过滤。通过这两种算法得出的备选项目使用特定的排序算法加入到推荐列表当中。此外,使用该方法得出的用户档案不适于长期使用,因为单独的一篇论文所包含的知识容量非常有限。

    斯坦福大学数字化图书馆项目研发的Fab也是一个集成了协同过滤与基于内容过滤的混合式推荐系统[5]。FAB的研发可以追溯到主流推荐引擎出现之前的1997年,用于从大量的网站中筛选出用户感兴趣的相关站点。推荐的依据是活跃用户及其相似用户对网站的评分。用户通过档案中的加权检索词向量进行描述。项目档案使用Rocchino算法通过相关性反馈进行更新。网站同时也通过一个100维的加权检索词向量进行表示,应用了TF-IDF模型[6]

    LIBRA是Learning Intelligent Book Recommendation Agent(智能学习图书推荐代理)的简称,专门为数字化图书馆的图书推荐而设计 ...

继续阅读

推荐系统中的主要推荐方法

在推荐系统简介中,我们给出了推荐系统的一般框架。很明显,推荐方法是整个推荐系统中最核心、最关键的部分,很大程度上决定了推荐系统性能的优劣。目前,主要的推荐方法包括:基于内容推荐、协同过滤推荐、基于关联规则推荐、基于效用推荐、基于知识推荐和组合推荐。

一、基于内容推荐

基于内容的推荐(Content-based Recommendation)是信息过滤技术的延续与发展,它是建立在项目的内容信息上作出推荐的,而不需要依据用户对项目的评价意见,更多地需要用机 器学习的方法从关于内容的特征描述的事例中得到用户的兴趣资料。在基于内容的推荐系统中,项目或对象是通过相关的特征的属性来定义,系统基于用户评价对象 的特征,学习用户的兴趣,考察用户资料与待预测项目的相匹配程度。用户的资料模型取决于所用学习方法,常用的有决策树、神经网络和基于向量的表示方法等。 基于内容的用户资料是需要有用户的历史数据,用户资料模型可能随着用户的偏好改变而发生变化。

基于内容推荐方法的优点是:
1)不需要其它用户的数据,没有冷开始问题和稀疏问题。
2)能为具有特殊兴趣爱好的用户进行推荐。
3)能推荐新的或不是很流行的项目,没有新项目问题。
4)通过列出推荐项目的内容特征,可以解释为什么推荐那些项目。
5)已有比较好的技术,如关于分类学习方面的技术已相当成熟。

缺点是要求内容能容易抽取成有意义的特征,要求特征内容有良好的结构性,并且用户的口味必须能够用内容特征形式来表达,不能显式地得到其它用户的判断情况。

二、协同过滤推荐

协同过滤推荐(Collaborative Filtering Recommendation)技术是推荐系统中应用最早和最为成功的技术之一。它一般采用最近邻技术,利用用户的历史喜好信息计算用户之间的距离,然后 利用目标用户的最近邻居用户对商品评价的加权评价值来预测目标用户对特定商品的喜好程度,系统从而根据这一喜好程度来对目标用户进行推荐。协同过滤最大优 点是对推荐对象没有特殊的要求,能处理非结构化的复杂对象,如音乐、电影。

协同过滤是基于这样的假设:为一用户找到他真正感兴趣的内容的好方法是首先找到与此用户有相似兴趣的其他用户,然后将他们感兴趣的内容推荐给此用 户。其基本思想非常易于理解,在日常生活中,我们往往会利用好朋友的推荐来进行一些选择。协同过滤正是把这一思想运用到电子商务推荐系统中来,基于其他用 户对某一内容的评价来向目标用户进行推荐。

基于协同过滤的推荐系统可以说是从用户的角度来进行相应推荐的,而且是自动的,即用户获得的推荐是系统从购买模式或浏览行为等隐式获得的,不需要用户努力地找到适合自己兴趣的推荐信息,如填写一些调查表格等。

和基于内容的过滤方法相比,协同过滤具有如下的优点:
1) 能够过滤难以进行机器自动内容分析的信息,如艺术品,音乐等。
2) 共享其他人的经验,避免了内容分析的不完全和不精确,并且能够基于一些复杂的,难以表述的概念(如信息质量、个人品味)进行过滤。
3) 有推荐新信息的能力。可以发现内容上完全不相似的信息,用户对推荐信息的内容事先是预料不到的。这也是协同过滤和基于内容的过滤一个较大的差别,基于内容的过滤推荐很多都是用户本来就熟悉的内容,而协同过滤可以发现用户潜在的但自己尚未发现的兴趣偏好。
4) 能够有效的使用其他相似用户的反馈信息,较少用户的反馈量,加快个性化学习的速度。

虽然协同过滤作为一种典型的推荐技术有其相当的应用,但协同过滤仍有许多的问题需要解决。最典型的问题有稀疏问题(Sparsity)和可扩展问题(Scalability)。

三、基于关联规则推荐

基于关联规则的推荐(Association Rule-based Recommendation)是以关联规则为基础,把已购商品作为规则头,规则体为推荐对象。关联规则挖掘可以发现不同商品在销售过程中的相关性,在零 售业中已经得到了成功的应用。管理规则就是在一个交易数据库中统计购买了商品集X的交易中有多大比例的交易同时购买了商品集Y,其直观的意义就是用户在购 买某些商品的时候有多大倾向去购买另外一些商品。比如购买牛奶的同时很多人会同时购买面包。 ...

继续阅读