社交网络近年来得到了突飞猛进的发展,用户不再是单纯的内容接收者,而是能够主动的建立用户之间的关系。这些关系,可以划分为显式关系 (explicit relations)和隐式关系(implicit relations)。显式关系指的是用户已明确建立的相关关系,例如在微博中关注/被关注某人等,或者在社区中加为好友等。而隐式关系指用户之间存在一 些互动行为,但这些行为不能明确指示用户间的关系。例如用户在微博中点击、评论、转发另一个用户的帖子,如果在网络游戏世界中另一个玩家交谈,或者PK 等。隐式关系虽然并不如显式关系那样明确,但比显式关系要丰富的多。所以在一些对推荐精度要求很高的应用场景下,显式关系需要发挥主要作用;而对一些需要 提高推荐召回率和推荐结果多样性的场景下,尤其是当显式关系面临数据稀疏性的问题时(注:这个问题在推荐应用中普遍存在),充分利用隐式关系能起到非常好 的效果。以今年的KDD-Cup竞赛为例,在腾讯微博的好友推荐系统上,我们通过在SVD++模型中增加隐式关系,处理数据稀疏性的问题,能够将推荐准确 率提升5.5%
此外,移动互联网的普及,让SNS关系使用起来更加便捷,而且加上地域信息,产生了像微信这样新颖的移动应用,而SNS关系和地域特征的结合使用,一定会让推荐系统也产生出更受欢迎的结果。
6 缓解冷启动问题
冷启动是推荐系统最为悠久的一个问题,伴随推荐系统诞生至今。这是因为推荐系统效果提升的关键天然在于数据,而当新用户、或新物品等刚上线时,由于积累的数据极为稀少,大量方法在最初这段时间难以生效。
冷启动问题又可细分为user冷启动或者item的冷启动。user冷启动在一些场景普遍存在,例如在一些短视频网站,由于user没有登录浏览的 习惯,因此大量来访用户都是陌生的cookie用户,如何对这些user进行推荐是至关重要的。常见的思路包括:1)采用热门推荐(排行榜)结果。虽然排 行榜是一个看似简单的方法,但设计良好、的排行榜并不如想象中简单,排行榜如何计算,基于哪些统计特征,都是值得深究的。2)充分利用有限的用户信息来迅 速捕捉偏好。例如用户的来源ip、访问时间、最初点击的几个结果的属性,都需要被充分运用。3)为新用户设置简单的口味测试,根据用户提交的答案主动收集 用户偏好。常见的方案包括为提供一些预先精心设计的选项,通过用户的选择迅速建立用户模型。在设计选项时,一些注意点包括:A)必须要有代表性的选 项;B)选项需要相对热门,或有一定的用户知名度;C)选项之间要有区分度。
item冷启动的问题在一些item频繁更新的应用中普遍存在,例如一些电子商务网站会不断上架新商品,这些新商品由于缺少点击,很难进行推荐。但 基于内容的方法(content-based)往往此时能发挥关键作用。根据item的类别、标签、关键词等初始特征,能计算item之间的关联度。尽管 很多对比评测表明,基于内容的推荐算法往往推荐精度不够高,但这种方法在处理item冷启动时有先天的优势,所以在工程实践中可以注意使用。









