Large-Scale Interactive Recommendation with Tree-Structured Policy Gradient AAAI2019 阅读笔记_tpgr-程序员宅基地

技术标签: 论文阅读  聚类  算法  树结构  深度学习  强化学习  


代码解释在另一篇文章~)
补充知识:

  • K-means:划分式聚类算法
  • 层次聚类算法:通过计算不同类别数据点间的相似度来创建一棵有层次的嵌套聚类树。
  1. 法一:
    每一个样本点视为一个簇;
    计算各个簇之间的距离,最近的两个簇聚合成一个新簇;
    重复以上过程直至最后只有一簇。

  2. 分割法(本文使用):
    先将数据点分为c个聚类
    再将分好的数据点继续划分为更小的聚类
    直到每个子聚类仅与一个点相关联。

Introduction

  • We propose a Tree-structured Policy Gradient Recommendation (TPGR) framework which achieves high efficiency and high effectiveness at the same time.
  • a balanced hierarchical clustering tree is built over the items and picking an item is thus formulated as seeking a path from the root to a certain leaf of the tree, which dramatically reduces the time complexity in both the training and the decision making stages.
  • We utilize policy gradient technique to learn how to make recommendation decisions so as to maximize long-run rewards.
  • 针对IRS(Interactive recommender systems)的算法及缺点 :
  1. MAB:假设用户兴趣在推荐过程中不变
  2. RL:无法处理大规模离散空间问题
  3. Wolpertinger Architecture[1]:一种针对动作空间来说复杂度为次线性而且在动作空间上能较好泛化的方法(基于actor-critic框架,通过DDPG来训练参数);存在学习的连续动作和实际期望的离散动作之间的不一致性的问题。

[1] Dulac-Arnold G, Evans R, van Hasselt H, et al. Deep reinforcement learning in large discrete action spaces[J]. arXiv preprint arXiv:1512.07679, 2015.

Methods

  • State. A state s is defined as the historical interactions between a user and the recommender system, which can be encoded as a low-dimensional vector via a recurrent neural network (RNN)
  • Action. An action a is to pick an item for recommendation
  • Reward. all users interacting with the recommender system form the environment that returns a reward r after receiving an action a at the state s, which reflects the user’s feedback to the recommended item.
  • Transition. As the state is the historical interactions, once a new item is recommended and the corresponding user’s feedback is given, the state transition is determined.

Tree-structured Policy Gradient Recommendation Intuition for TPGR

在这里插入图片描述
每个叶节点都映射到item,每个非叶节点与policy network相关联
给定一个state,在policy network的引导下,从根节点到叶节点进行自顶向下的移动,并向用户推荐相应的item

Balanced Hierarchical Clustering over Items

在这里插入图片描述

  • 平衡树:对于每个节点,其子树的高度最多相差1。
  • 每个非叶节点具有相同数量的子节点,表示为c。(叶节点的父节点除外)
  • 通过聚类算法以一组向量(这里我理解的是所有item的向量)和整数c为输入,并将向量分成c个平衡的聚类;通过重复应用聚类算法直到每个子聚类只与一个item相关联,构建了一个平衡的聚类树。
    在这里插入图片描述
  • 采用的聚类方法:
  1. PCA-based(better)
  2. K-means-based
  • 采用的item向量表示方式:
  1. Rating-based:用评分矩阵对应列表示(后续实验表明这是最佳表示方法);
  2. VAE-based:使用变分自编码器降维;
  3. MF-based:使用矩阵分解表示item

Architecture of TPGR

  • status point指示当前位于哪个节点,选择item就变成将status point从根节点移到某个叶子节点。
  • 树的非叶节点与policy network相关联(全连接层+激活单元)。
    status point所在的节点v的policy network以当前state为输入,输出v在子节点上的概率分布,表示移动到v每个子节点的概率。
    在这里插入图片描述

State Representation

  • 输入为时间t前推荐的item ids以及相应的rewards,其中每个item id都被映射为一个embedding vector(可以端到端训练,也可以使用MF提前训练好),每个reward映射为一个one-hot向量。
  • user_status表示一些统计信息,如在时间步长t之前的positive reward、negative reward 、连续的positive reward和negative reward的数量
  • 采用SRU(simple recurrent unit)编码,得到state
    在这里插入图片描述

Experiments and Results

  • 数据集:
    在这里插入图片描述
  • 将评分大于3视为positive reward,其余视为negative reward
    在这里插入图片描述
  • 纵坐标为连续positive(negative) reward的平均分。
  • 表明用户以前消费的满意(令人失望)的项目越多,她获得的快乐(不愉快)就越多,因此,她倾向于对当前项目给出更高(更低)的评级

结果:

在这里插入图片描述

Time Comparison

在这里插入图片描述
虽然DDPG-KNN(k=1)时间复杂度低,但是推荐性能很差

Influence of Clustering Approach & Tree Depth

在这里插入图片描述
结果表明:PCA聚类方式,rating-based向量表示方式,深度为2时,效果最好
原因分析:

  1. Rating-based保留了用户和item之间的所有交互信息,而VAE和MF的表示都是低维的,在降维后保留的信息比基于评分的表示少。
  2. K-means方法对初始点的选择以及距离函数度量都有要求,不稳定。
版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
本文链接:https://blog.csdn.net/strawberry47/article/details/116697266

智能推荐

240320俄罗斯方块java,JAVA游戏编程之三----j2me 手机游戏入门开发--俄罗斯方块_2-程序员宅基地

文章浏览阅读202次。packagecode;//importjava.awt.*;//importjava.awt.Canvas;//importjava.awt.event.*;//importjavax.swing.*;importjava.util.Random;importjavax.microedition.lcdui.*;//写界面所需要的包/***//***俄罗斯方块*高雷*2007年1..._240×320java游戏

在线电影院售票平台(源码+开题报告)-程序员宅基地

文章浏览阅读779次,点赞14次,收藏19次。然后,实现系统的数据管理和服务功能,包括用户的注册与登录、电影的分类与展示、电影信息的查询与推荐、座位的选择与预订、在线支付与电子票生成等。此外,随着在线视频平台的兴起,越来越多的人选择在线观看电影,这对传统电影院产生了巨大的冲击。研究意义: 开发在线电影院售票平台对于提升用户的观影体验、优化电影院的运营效率、促进电影产业的发展具有重要的意义。该系统旨在通过技术手段解决传统电影院售票中的问题,提供一个集成化的电影信息展示、座位选择、在线支付和用户评价平台,同时也为电影院和电影制作方提供有效的工具。

程序员熬夜写代码,用C/C++打造一个安全的即时聊天系统!_基于c++的即时聊天系统设计-程序员宅基地

文章浏览阅读509次。保护我们剩下的人的通话信息安全,使用TOX可以让你在和家人,朋友,爱人交流时保护你的隐私不受政府无孔不入的的偷窥.关于TOX:其他牛逼的软件因为一些细化服务问你要钱的时候, TOX分文不取 . 你用了TOX, 想干嘛就干嘛.网友评论:项目源码展示:源码测试效果:最后,如果你学C/C++编程有什么不懂的,可以来问问我哦,或许我能够..._基于c++的即时聊天系统设计

linux Java服务swap分区被占用内存泄露问题故障及解决方法_linux swap占用很高-程序员宅基地

文章浏览阅读584次。鱼弦:CSDN内容合伙人、CSDN新星导师、全栈领域创作新星创作者 、51CTO(Top红人+专家博主) 、github开源爱好者(go-zero源码二次开发、游戏后端架构 https://github.com/Peakchen)当Java服务在Linux系统中运行时,可能会出现swap分区被占用的内存泄露问题,导致系统性能下降或者崩溃。下面是该问题的故障及解决方法、底层结构、架构图、工作原理、使用场景详解和实际应用方式、原理详细描述、相关命令使用示例以及文献材料链接。_linux swap占用很高

word中利用宏替换标点标点全角与半角-程序员宅基地

文章浏览阅读662次。Alt+F11,然后插入-模块:复制下面代码到编辑窗口:Sub 半角标点符号转换为全角标点符号()'中英互译文档中将中文段落中的英文标点符号替换为中文标点符号 Dim i As Paragraph, ChineseInterpunction() As Variant, EnglishInterpunction() As Variant Dim MyRange..._替换半角宏

Android WebView使用总结_android webview真正加载完成-程序员宅基地

文章浏览阅读2.8k次。#.简介: WebView是Android提供的用来展示展示web页面的View,内部使用webkit浏览器引擎(一个轻量级的浏览器引擎),除了展示Web页面外,还可与Web页面内的JS脚本交互调用。WebView内部的WebSetting对象负责管理WebView的参数配置; WebViewClient负责处理WebView的各种请求和通知事件,在对应事件发生时会执行WebViewClient的对应回调; ChromeWebviewClient辅助Webview处理与JS一些交互......_android webview真正加载完成

随便推点

bitcoin 调试环境搭建-程序员宅基地

文章浏览阅读1.6k次。_bitcoin 调试环境搭建

曲线生成 | 图解B样条曲线生成原理(基本概念与节点生成算法)-程序员宅基地

文章浏览阅读4.3k次,点赞93次,收藏94次。为了解决贝塞尔曲线无法局部修正、控制性减弱、曲线次数过高、不易拼接的缺陷,引入B样条曲线(B-Spline)。本文介绍B样条曲线的基本概念:节点向量、支撑性、次数阶数、加权性质、节点生成算法等,为后续曲线计算打下基础。_样条曲线生成

CDH安装宝典之ClouderaManager_/opt/cloudera/cm-agent/service/mgmt/mgmt.sh: line -程序员宅基地

文章浏览阅读902次。配置本地repo库下载我的阿里云盘文件文件放置#创建目录mkdir -p /opt/cloudera/parcel-repo/mkdir -p /opt/cloudera/cm/yum install createrepoCDH 6.2.0 的三个文件放到/opt/cloudera/parcel-repo/中,并且注意把sha256后缀的文件名修改为sha#执行createrepo命令生成rpm元数据 最终/opt/cloudera/parcel-repo/会多一个repodata目录_/opt/cloudera/cm-agent/service/mgmt/mgmt.sh: line 76: /usr/java/jdk1.8.0_181

uni.canvasToTempFilePath在app正常,微信小程序报错: fail canvas is empty-程序员宅基地

文章浏览阅读943次,点赞2次,收藏2次。uni.canvasToTempFilePath_uni.canvastotempfilepath

SDRAM笔记_sdram 干扰-程序员宅基地

文章浏览阅读3.1k次。SRAM :静态RAM,不用刷新,速度可以非常快,像CPU内部的cache,都是静态RAM,缺点是一个内存单元需要的晶体管数量多,因而价格昂贵,容量不大。DRAM:动态RAM,需要刷新,容量大。SDRAM:同步动态RAM,需要刷新,速度较快,容量大。DDR SDRAM:双通道同步动态RAM,需要刷新,速度快,容量大。........................_sdram 干扰

Excel转SQL语句_excel数据怎么生成sql语句-程序员宅基地

文章浏览阅读7.3k次。假设表格有A、B、C、D四列数据,希望导入到你的数据库中表格table,对应的字段分别是col1、col2、col3、col4。_excel数据怎么生成sql语句

推荐文章

热门文章

相关标签