谣言检测数据集

news2024/9/25 17:21:02

1 PHEME-R 

这是一个在PHEME FP7项目的新闻学用例中收集和注释的数据集。这些谣言与9个不同的突发新闻相关。它是为分析社交媒体谣言而创建的,包含由谣言推文发起的推特对话;对话包括对这些谣言推文的回应推文。这些推文已经被注解为支持度、确定性和证据性。

该数据集包含330个对话线程(297个英语,33个德语),每个线程都有一个文件夹。

年份:2016

下载链接: PHEME rumour scheme dataset: journalism use case

2 PHEME dataset

        这个数据集包含了突发新闻期间发布的Twitter谣言和非谣言的集合

        该数据的结构如下。每个事件都有一个目录,有两个子文件夹,谣言和非谣言。这两个文件夹有以推特ID命名的文件夹。推文本身可以在相关推文的'源推文'目录中找到,而'反应'目录中有回应该源推文的一组推文。同时,每个文件夹都包含'annotation.json',它包含关于谣言的真实性的信息,以及'structure.json',它包含关于对话结构的信息

        该数据集是PHEME谣言和非谣言数据集的延伸(https://figshare.com/articles/PHEME_dataset_of_rumours_and_non-rumours/4010619),它包含了与9个事件相关的谣言,每个谣言都被标注了其真实性值,即真、假或未验证。

        时间: 2018年

        这个数据集被用在论文“All-in-one: Multi-task Learning for Rumour Verification"。更多细节,请参考该论文。

Ma-Twitter

        Twitter.txt:这个语料库总共包含992个有标签的事件。每一行都包含一个事件和相关推文的ID:event_id, label, tweet_ids。对于标签,如果该事件是一个谣言,其值为1,否则为0。请注意,由于Twitter数据的使用条款,我们不能公布推文的具体内容。用户可以通过Twitter的API自己下载这些内容。

        Twitter_event_claims.txt:这个文件提供了每个事件的主要声明内容。每一行都包含一个事件,其声明由event_id和声明内容组成。在这个文件中,只包括我们自己从Snopes.com上收集的事件的声明,而标为 "未知 "的声明则是从两篇论文中构建的其他数据集(为了平衡我们的类别分布)借来的。

4 Ma-Weibo

        微博数据(weibo.txt)。这个语料库总共包含4664个有标签的事件。每一行都包含一个事件和相关帖子的ID,格式为:event_id, label, post_ids。对于标签,如果该事件是一个谣言,其值为1,否则为0。我们还以json格式发布所有帖子的内容,这些内容被保存在./Weibo目录下,每个文件被命名为event_id.json,对应于单个事件。

        需要注意的是,我们并没有为每个微博事件明确地产生声明,因为我们直接从新浪社区管理中心收集事件的传播线程,每个事件的源帖(第一篇)可以被视为主要的声明。

5 Twitter 15 和 Twitter 16

下载链接:https://www.dropbox.com/s/7ewzdrbelpmrnxu/rumdetect2017.zip?dl=0

介绍:在本文中,我们试图根据微博帖子的传播结构来解决从微博帖子中识别谣言 (即虚假信息) 的问题。我们首先使用传播树对微博帖子的传播进行建模,这些传播树为原始消息的传播和发展提供了有价值的线索

论文链接:Detect Rumors in Microblog Posts Using Propagation Structure via Kernel Learning

6 BuzzFeedNews

下载链接:https://github.com/BuzzFeedNews/2016-10-facebook-fact-check

你可以在这里找到所有帖子、事实核查评分和 Facebook 参与度数据的电子表格。收集和评价页面的方法可以在主文章的开头和结尾。
Facebook 的参与数据是从2016年10月11日的 Facebook API 中获得的。

论文:"Hyperpartisan Facebook Pages Are Publishing False And Misleading Information At An Alarming Rate,"

数据集格式:

SemEval19-2019年 - text/user info/time stamp/ propagation info

论文链接:SemEval-2019 Task 7: RumourEval, Determining Rumour Veracity and Support for Rumours - ACL Anthology

        提供了一个可疑帖子和随后在社交媒体中进行对话的数据集,并注释了立场和准确性。社交媒体的谣言源于各种突发新闻,数据集被扩展到包括Reddit以及新的Twitter帖子。

下载链接:RumourEval 2019 data

Task A (SDQC)

        与预测谣言真实性的目标有关,第一个子任务将处理跟踪其他来源如何适应谣言故事准确性的补充目标。分析周围话语的关键步骤是确定社交媒体中的其他用户如何看待谣言。我们建议通过查看对提出谣言声明的帖子 (即原始谣言 (来源) 帖子) 的答复来解决这一分析。我们将为参与者提供由回复原始谣言帖子的帖子组成的树状对话,每个帖子都针对谣言提供自己的支持。我们以支持,拒绝,查询或评论 (SDQC) 声明的方式来构建此框架。因此,我们引入了一个子任务,其目标是标记给定语句 (谣言帖子) 和回复帖子 (后者可以是直接或嵌套回复) 之间的交互类型。树状结构线程中的每个推文都必须分为以下四个类别之一:

        支持: 回应的作者支持他们回应的谣言的真实性;

        否认: 回应的作者否认他们回应的谣言的真实性;

        查询: 答复的作者要求提供与他们所回应的谣言的真实性有关的其他证据;

        评论: 回应的作者发表了自己的评论,但没有对评估他们所回应的谣言的真实性做出明确的贡献。

任务 B (验证)

        第二个子任务的目标是预测给定谣言的准确性。该谣言以事后报告或质疑的形式提出,但在发布时被认为没有根据。鉴于这样的主张以及提供的一组其他资源,系统应返回一个标签,该标签将谣言的预期真实性描述为真或假。这项任务的基本事实是由团队的记者和专家成员手动确定的,他们确定官方声明或其他可信赖的证据来源,以解决给定谣言的真实性。将提供其他上下文作为准确性预测系统的输入; 此上下文将包括在谣言报道之前立即检索到的相关来源的快照,包括相关Wikipedia文章的快照,Wikipedia转储,从NewsDiffs检索到的数字新闻媒体的新闻文章,以及同一事件的先前推文。至关重要的是,不得使用包含谣言解决后信息的外部资源。为了控制这一点,我们将指定参与者可能使用的外部信息的精确版本。这对于确保我们将时间敏感性引入准确性预测任务很重要。我们采取一种简单的方法来完成这项任务,只对谣言使用正确/错误的标签。然而,实际上,许多说法很难核实; 例如,有许多关于弗拉基米尔·普京 (Vladimir Putin) 在2015年的活动的谣言,许多谣言完全没有根据。因此,我们还期望系统对每个谣言返回0-1范围内的置信度值; 如果谣言不可验证,则应返回0的置信度。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/131418.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

VS2012安装教程

我要学只有我们两个人懂得C语言。 安装包:https://pan.baidu.com/s/1YR7Xk9Zlv7zQWCsERdVgIQ [提取码]:stvi 1、右键以管理员身份运行 “vs_ultimate.exe” 2、编辑软件安装位置,然后点击同意许可,之后点下一步即可! 3…

mongoDB聚合查询

管道 管道在Unix和Linux中一般用于将当前命令的输出结果作为下一个命令的参数。MongoDB的聚合管道将MongoDB文档在一个管道处理完毕后将结果传递给下一个管道处理。管道操作是可以重复的。 聚合管道操作 可参考菜鸟文档:菜鸟文档 命令 功能描述 $project指定输出…

shell第四天作业——流程控制之循环

题目 一、for创建20个用户,用户前缀由用户输入,用户初始密码由用户输入。 二、for循环ping测试指定网段的主机,网段由用户输入。 三、使用for/while实现批量主机root密码的修改 一、for创建20个用户,用户前缀由用户输入&#x…

2022年已然要结束了,一起来分享下你的故事吧!2023年的接力棒已经递到手里,千言万语不如一句Fighting!

【系列专栏】:博主结合工作实践输出的,解决实际问题的专栏,朋友们看过来! 《QT开发实战》 《嵌入式通用开发实战》 《从0到1学习嵌入式Linux开发》 《Android开发实战》 《实用硬件方案设计》 长期持续带来更多案例与技术文章分享…

c++语法欠缺地方

sizeof是用来计算变量占多大内存的,单位是字节(byte);sizeof 后面跟类型时,必须加上括号,例如sizeof(double);后面跟变量可以不用加括号,例如:sizeof d%d是以十进制形式输出有符号整…

CDP集群卸载过程

CDP集群卸载过程 1. 登录到Cloudera Manager,并停止整个集群服务。 2. 停用并移除所有Parcel 3. “停用”CDH7的Parcel。 4. 从主机删除”CDH6的Parcel 5. 删除集群 6. 登录server机器,停止CM Server服务 systemctl stop cloudera-scm-server 7. 移除…

如何实现高性能点赞(三)

数据库设计 数据库表中至少要包含三个字段:被点赞用户id,点赞用户id,点赞状态。再加上主键id,创建时间,修改时间就行了。 建表语句 对应的对象 UserLike 数据库操作 操作数据库同样封装在接口中 LikedService L…

【2.2】服务拆分--服务远程调用

服务拆分--服务远程调用1 案例--根据订单id查询订单功能2 远程调用方式分析2.1 注册RestTemplate2.2 发http请求3 总结1 案例–根据订单id查询订单功能 需求:根据订单id查询订单的同时,把订单所属的用户信息一起返回。 由上一节的测试结果可以看出&…

opencv-python常用函数解析及参数介绍(五)——腐蚀与膨胀

腐蚀与膨胀前言膨胀腐蚀开运算与闭运算礼帽与黑帽运用膨胀和腐蚀获得图像轮廓前言 有些时候图片上会有一些划痕或者污渍,会影响图片的质量,假设我有一张写有“艾醒”的图片,但是有花花绿绿的划痕和污渍,这时我们就可以运用腐蚀与…

五、Web自动化测试

Web自动化测试5.1 Selenium Web 自动化5.1.1 Selenium 和 Robot Framework SeleniumLibrary 库介绍安装 robotframework-seleniumlibrary导入 SeleniumLibrary5.1.2 Open Browser 和 Close Browser5.1.3 Input Text5.1.4 Click Button5.1.5 Click Element5.1.6 Click Link5.1.7…

2022CTF培训(十)IOT 相关 CVE 漏洞分析

附件下载链接 这里选择的设备是一款家用路由器,型号为 D-Link DIR-850L(EOL) 。由于该款路由器已停产,官网无法下载到固件,不过目前这个网站还能下载到相关的固件,当然附件中也会提供需要分析的固件。 固件解密 以 DIR850LB1_FW…

归一化 (Normalization)、标准化 (Standardization)和中心化/零均值化 (Zero-centered)

目录 一、概念 1、归一化(Normalization): 2、标准化(Standardization): 3、中心化/零均值化(zero-centered): 二、联系和差异: 三、标准化和归一化的多种…

Faster RCNN网络源码解读(Ⅵ) --- RPN网络代码解析(上)RPNHead类与AnchorsGenerator类解析

目录 一、代码作用(rpn_function.py) 二、代码解析 2.1 RPNHead类 2.2 AnchorsGenerator类 2.2.1 初始化函数__init__ 2.2.2 正向传播过程 forward 2.2.3 set_cell_anchors生成anchors模板 2.2.4 generate_anchors生成anchors 2.2.5 cached_g…

【Linux】vim 中批量添加注释

本期主题:vim 中批量添加注释博客主页:小峰同学分享小编的在Linux中学习到的知识和遇到的问题小编的能力有限,出现错误希望大家不吝赐 此文主要介绍两种方法:方法一 :块选择模式;方法二: 替换命令 &#x…

Java基础随手记

数组 数组的使用 数组可以存放多个同一类型的数据,数组也是一种数据类型,是引用类型。即:数组就是一组数据 问题引入 传统的解决方式 使用数组来解决 可以看到,我们创建了一个double类型元素的数组,将我们要计算…

buuctf-misc-[GKCTF 2021]你知道apng吗1

先下载附件,快要过年了,十二月份还没发过文章,紧急写一篇。 下载文件后缀名为apng 搜索一下APNG(基于PNG的位图动画格式)_百度百科 利用火狐浏览器可以打开 类似gif图片的格式,用专门工具进行拆解&#xf…

MySQL内部的核心组件

mysql前言 1.MySQL的驱动 2.数据库的连接池 3.MySQL的工作线程 4.SQL接口 5.SQL解析器 6.查询优化器 7.执行器组件 8.存储引擎接口 1.MySQL的驱动是做什么的? 尤其记得刚刚学习MySQL的时候,引入的pom坐标:mysql-connector-java,这…

软考- 计算机组成原理与体系结构

【考点梳理】 考点1、数据的表示(★★★★) 考点1.1、进制的转换 【考法分析】 本考点的基本考法是与内存地址计算、IP地址计算结合考查。 【要点分析】 1、十进制转R进制(短除法); 2、R进制转十进制&#xff0…

Arduino与Proteus仿真实例-WS2812实现音乐氛围灯仿真

WS2812实现音乐氛围灯仿真 本文将使用WS2812实现一个音乐氛围灯。Arduino通过检测音频信号强度,然后转换成W2812灯带驱动信号,从而实现音乐氛围灯。 WS2812的驱动和使用在前面的文章中作了详细的介绍,请参考: Arduino与Proteus仿真实例-WS2812-RGB-LED灯带酷炫效果仿真Ar…

【软件质量】软件质量分析总结报告

软件质量-----“软件与明确地和隐含地定义的需求相一致的程度” 一、质量的概念 Ⅰ、传统的质量概念:产品性能是否符合技术规范 Ⅱ、质量是一组固有特性满足要求的程度 Ⅲ、适用性质量 Ⅳ、质量不仅指产品质量,也指过程和体系的质量 二、软件质量 Ⅰ、产品质…