基于CNN的在线论坛抑郁与自残风险评估——EMNLP 2017最佳长论文阅读笔记

基于CNN的在线论坛抑郁与自残风险评估——EMNLP 2017最佳长论文阅读笔记
基于CNN的在线论坛抑郁与自残风险评估——EMNLP 2017最佳长论文阅读笔记论文信息论文标题Depression and Self-Harm Risk Assessment in Online Forums会议EMNLP 2017最佳长论文论文链接arXiv:1709.01848作者团队作者背景Andrew Yates第一作者乔治城大学计算机博士目前在德国马克思普朗克信息学院从事博士后研究博士期间已发表多篇深度学习信息检索/NLP相关论文Arman Cohan第二作者伊朗籍乔治城大学计算机系博士生在信息检索和NLP料向发表多篇论文曾在Medstar Health和Adobe研究院实习Nazli Goharian第三作者/导师乔治城大学计算机系教授20年产学研经验信息检索与文本分析领域发表20余篇论文研究背景与问题现代社会精神疾病问题日益突出大量患者在Reddit、Twitter等在线社区中寻求帮助和交流。研究这些用户的在线行为对设计更契合其需求的辅助系统、帮助社会研究人员分析其精神状态具有重要意义。论文提出的核心问题是如何利用NLP技术自动检测在线论坛用户是否患有抑郁症以及评估其自残风险等级主要贡献构建了大规模标注数据集从Reddit 2006-2016十年数据中挖掘通过语料库句式匹配如我已经被诊断得了抑郁症高精度筛选帖子经人工标注得到9210个精神疾病用户正例并采用严格匹配策略找到107274个负例用户。正负例用户在其他特征上尽量相似确保对比的有效性。每个用户平均发布969个帖子平均长度超过140字。评估自残风险的数据集利用ReachOut在线社区数据包含65024个论坛帖子其中1227个涉及自残并按紧急程度分为五个等级。提出了通用的CNN文本分析框架可同时适用于抑郁症检测和自残风险评估两个任务。核心方法CNN文本分析框架整体流程分为三步第一步帖子级特征提取CNN对每个帖子的单词序列卷积层Convolutional Layer对一定窗口范围内的单词提取局部特征最大池化层Max Pooling Layer对卷积提取的特征进行集中降维输出每个帖子转换为一个特征向量Feature Vector本质上就是将图像处理中的标准卷积操作迁移到文本上。第二步用户级表征构建根据任务不同采用不同的聚合策略任务聚合方式抑郁症检测将该用户所有帖子的特征向量直接取平均自残风险评估将所有帖子平铺拼接并将当前帖子之前的帖子作为负例一并拼接不做平均处理第三步分类器构建使用多层全连接层Fully Connected Layer将用户表征映射到目标标签。实验结果抑郁症检测任务方法PrecisionRecallF1本文方法CNN—0.450.51SVM 文本特征0.720.29—本文方法在召回率上明显优于SVM基线F1值综合更高。自残风险评估任务指标数值准确率0.89F1值0.61在所有对比方法中均取得最优效果。核心要点总结这是NLP技术应用于社会问题的一次成功实践——用深度学习自动识别精神疾病用户具有现实意义。论文构建的大规模、高质量标注数据集本身就是一个重要贡献。方法思路上清晰通用CNN提取帖子特征 → 按任务聚合为用户表征 → 全连接层分类这一模式可迁移到其他文本挖掘场景。卷积操作在文本上的有效性值得关注图像中卷积捕捉局部空间模式文本中则捕捉局部语义组合如短语、搭配本质上都是在提取局部特征。阅读笔记 · 整理自极客时间《AI技术内参》

最新新闻

日新闻

周新闻

月新闻