编者按:本文来自量子位(公众号:QbitAI),李杉 编译自 MIT技术评论,36氪经授权发布。
“互联网的出现和随后的信息爆炸导致记者越来越难以准确、迅速地获取新闻。”路透社的研发团队本周在arXiv的一篇论文的开场白中如此写道。
对于路透社来说,假新闻的出现导致这个问题变得更加尖锐,因为这些假新闻扭曲了人们对事件的感知。
然而,美联社等新闻机构已经开始使用自动化的新闻写作服务。他们会采用标准的模式,例如,在报道财经新闻和体育比赛结果时,直接将数据粘贴到预先编写的模板中:“X公司第三季度实现利润Y万美元,超出华尔街预期……”
因此,其他新闻机构也面临压力,必须启用自动化新闻制作技术。今天,路透社阐述了它是如何在时间发生后第一时间完全通过自动化技术识别突发新闻的。
刘小沫(XIaomo Liu,音译)他的在路透社研发部门及阿里巴巴的同事表示,这套新系统运行良好。事实上,它有可能彻底改变新闻行业。但这也引发了人们的担忧,他们担心这样一套系统可能被心怀恶意的人控制。
这个新系统被称为路透社追踪器(Reuters Tracer)。它使用Twitter作为一种全球传感器,记录新闻事件的发生。系统之后使用各种类型的数据挖掘和机器学习来挑选出最相关的事件,确定它们的主题,排列它们的优先级,写出标题和摘要。之后,这些新闻就会发布在该公司的全球新闻专线上。
流程的第一步是吸收Twitter的数据流。追踪器每天查看大约1200万条推文,占总数的2%。其中一半是随机抽样,另外一半来自路透社记者的Twitter帐号列表,包括其他新闻机构的帐号、重要的公司、有影响力的个人等。
下一步是确定新闻事件发生的时间。追踪器这样做的前提假设是:如果几个人同时开始谈论这件事,这个事件就已经发生。因此它使用聚类算法来寻找这些对话。
当然,这些聚类包括垃圾信息、广告、普通聊天等。只有一部分涉及有新闻价值的事件。所以下一个步是对事件进行分类和排序。追踪器使用许多算法来完成这项工作。
第一个算法负责确定对话主题。之后将此与路透社团队从31个官方新闻帐号收集的推文进行对比,包括@CNN、@BBCBreaking和@nytimes,以及@BreakingNews等新闻聚合器。
在这个阶段,这套算法还会使用一个包含城市和地理位置的关键词数据库来判断事件发生的地点。
一旦一段谈话或谣言被认为可能是新闻,关键就是要确认它的真实性。为了确定这一点,追踪器需要找出对话中提到的最早的推文和它所指向的网站,以此来寻找来源。然后,它会查询了一个数据库,其中列出了已知的虚假新闻制作者,如《National Report》,或者讽刺新闻网站《The Onion》
最后,该系统会写出标题和摘要,并在整个路透社中分发新闻。
路透社的团队表示,在试验过程中,该系统运行良好。他们说:“追踪器能够在新闻探测和传播上实现有竞争力的准确度和时效性。”
他们有统计数据来支持这一点。该系统每天处理1200万条推文,大约80%的都是噪音。剩下的大约会归入6000个聚类,系统将其视作不同类型的新闻事件。这都是由13个运行10个不同算法的服务器完成的。
相比之下,路透社在世界各地雇佣了大约2500名新闻记者,他们每天都使用包括Twitter在内的各种来源制作大约3000条新闻提示。其中大约有250条是新闻故事。
路透社将追踪器识别的新闻与BBC和CNN等机构新闻的信息流中出现的新闻进行对比。刘小沫和他的同事说:“结果显示,追踪器可以用2%的Twitter数据覆盖70%的新闻报道。”
这套系统的运行速度很快。该团队举了一个例子:2017年10月,拉斯维加斯枪击案导致58人死亡。有目击者在凌晨1点22分报告了这一事件,触发了一个追踪器聚类。
然而,这个聚类不符合系统给事件制定的标准,因而直到凌晨1点39分才被包含到信息流中。“路透社在凌晨1点49分报道了此事。”刘小沫和他的同事说。
这是一项有趣的工作,但也引发了许多问题,特别是关于系统的易用性。不难想象,心怀不轨的人会设计专门的Twitter消息来欺骗追踪器。
不过,这套系统是否比现有的系统更容易欺骗,恐怕还很难判断。毕竟,人类记者也经常被各种假消息欺骗。
此外,人类在新闻行业仍要扮演自己的角色。未来的新闻肯定会越来越自动化,人类如何融入其中仍然无法确定。
论文地址:
https://arxiv.org/abs/1711.04068