高考考试网
当前位置: 首页 高考资讯

浏览器开发者模式学习(腾讯QQ浏览器实验室文本语义匹配训练策略)

时间:2023-06-11 作者: 小编 阅读量: 4 栏目名: 高考资讯

今年的ACL大会已是第60届,于5月22-5月27举办。受到疫情影响,国内NLP从业者参与大会受到很多限制。该论文已被ACL2022接收。是每个序列前面的一个特殊标记,这个标记对应的最终隐藏状态作为整个序列的表示。在fine-tuning阶段,仅引入分类层来进行最终的预测。数据可见,所有PLMs的匹配精度在两个数据集上都稳定增加。这表明关键词和意图的信息是文本语义匹配的重要特征。

机器之心报道

作者:QQ浏览器实验室

这篇ACL 2022研究提出了一个简单而有效的文本语义匹配的训练策略,通过分治的方式将关键词从意图中分离出来。

作为国际最受关注的自然语言处理顶级会议,每年的 ACL 都吸引了大量华人学者投稿、参会。今年的 ACL 大会已是第 60 届,于 5 月 22-5 月 27 举办。受到疫情影响,国内 NLP 从业者参与大会受到很多限制。

为了给国内 NLP 社区的从业人员搭建一个自由轻松的学术交流平台,机器之心在 5 月 21 日组织了「ACL 2022 线上论文分享会」。

腾讯 QQ 浏览器搜索技术部高级工程师唐萌为我们带来了论文《Divide and Conquer: Text Semantic Matching with Disentangled Keywords and Intents》分享。该论文已被 ACL 2022 接收。

以下是唐萌论文分享的回顾视频链接。本文也对该论文核心内容进行了介绍。

回放链接:https://b23.tv/mWt6ofN

论文地址:https://arxiv.org/abs/2203.02898

文本语义匹配是一项被广泛应用到各种场景的基本任务,如社区问答、信息检索和推荐等。最新的匹配模型,例如 BERT,通过统一处理每个词来直接进行文本的比较。然而,查询语句通常需要在不同的粒度上与内容进行匹配。具体的,关键词代表了应该严格匹配的事实信息,如动作、实体、事件。而意图词则表达了抽象的概念和想法,通常有多种表达方式。在这项工作中,我们提出了一个简单而有效的文本语义匹配的训练策略,通过分治的方式将关键词从意图中分离出来。我们的方法可以很容易的与预训练语言模型(PLM)相结合,不影响其推理效率。在三个基准集上,实现了在广泛 PLM 模型上的稳定效果提升。

DC-Match 匹配,可以很容易的与文本匹配分类模型相结合。它包括三个训练目标,即: 全局匹配模型的分类损失;基于远程监督的分类损失,用于区分出关键词和意图;遵循分治思想的特殊训练目标,使用 KL-divergence 来确保全局匹配分布 (原始问题) 与分离开关键词和意图 (子问题) 后所得出的组合分布是相似的。

1、基于 PLMs 的文本语义匹配

首先, 我们定义文本语义匹配任务,即给定两个文本序列

和

,文本语义匹配的目标是学习一个分类器

来预测序列

是否是语义等价的。这里

代表两个序列中第 i 个和 j 个词,

代表两个序列的长度,y 可以是二分类的目标来预测两个序列是否等价,也可以是多分类目标来反映文本序列的匹配程度。

最近,预训练语言模型 (PLM) 在文本理解和表征学习方面取得了显著的成功。它们在具有启发式自监督学习目标的大规模文本语料库上被预训练,然后被作为强有力的序列分类器在下游分类任务中被 fine-tuning。对于文本语义匹配任务,通常通过增加

来连接

,并作为 PLM 编码器的输入序列。

是每个序列前面的一个特殊标记,这个标记对应的最终隐藏状态作为整个序列的表示。在 fine-tuning 阶段,仅引入分类层来进行最终的预测。这里

代表可训练的权重,K 代表分类的类别数:

最后,我们计算微调的标准分类损失如下:

2、基于远程监督分离出关键词和意图

我们假设每个句子都可以分解为关键词和意图。直观地说,关键词代表事实信息,例如应该严格匹配的动作和实体,而意图传达可以用不同方式表达的抽象概念或想法。通过将关键字从意图中分离出来,匹配过程可以分成两个更容易的子问题,这两个子问题需要不同级别的匹配粒度。

在缺乏人工标注数据的前提下,为了自动的分离开关键词和意图, 我们借鉴了远程监督方法。我们通过引入外部知识库中的实体, 来提取原始文本中的实体提及来自动生成关键词标签。所有提取的实体被标记为关键词,句子中的剩余单词被标记为意图。在获得弱标签信息后,我们添加一个辅助训练目标,迫使模型学习分离出关键字和意图。

给定 PLM 的输出,我们把输出分为两组, 分别对应关键词分类和意图词分类两个目标,分类目标的损失函数如下, 其目标是推动 PLM 学习关键字和意图的表示, 使得它们彼此远离, 使得模型可以在不同的粒度上对句子内容进行建模:

3、分治匹配策略

我们将原匹配问题分成两个更容易的子问题: 关键词匹配和意图匹配,并假设它们相互独立,然后将子问题的解组合起来,给出原问题的解。

我们假设每个子问题遵循与原问题相同的目标,组合得到的概率分布 Q(y)可以从两个子问题的联合概率分布 P(yk, yi) 导出, 如下:

其中,

表示匹配度的目标类别,

意味着

具有比

更高的匹配分数。例如,在三类场景中,y ∈ {2,1,0}分别表示完全匹配、部分匹配和不匹配,Q(y = 0)即至少有一个子问题被推断为不匹配的概率。

为了对子问题建模,我们重新使用 PLM 模型来分别对关键词和意图进行匹配,并且获得条件概率

代表 mask 掉意图的文本序列,

代表 mask 掉关键词的文本序列。那么,在独立子问题的假设下,

的条件联合分布为:

最后,为了确保全局匹配分布 (原始问题) 与子问题的组合解分布相似,我们使用双向 KL - 散度来最小化两个分布之间的距离,通过这种方式,我们期望全局匹配模型学会更好地做出最终预测:

训练和推理

在训练阶段,我们结合三个损失函数

来联合训练模型:

在推理时,我们根据原问题的条件概率直接推断句子对的匹配类别,即:

这意味着我们的推理过程与 PLM 基线完全相同,没有额外的计算。虽然我们使用外部语料库来自动获得远程监督的标签,但它可能会导致信号不完整或有噪声,从而给子问题引入偏差。因此,,我们只在训练阶段使用其标签作为全局匹配模型的辅助信息来进行增强。

实验

在实验阶段, 我们在三个文本语义匹配基准上评估了我们的方法和所有基线:两个英文数据集 MRPC 和 QQP,以及一个中文数据集 Medical-SM。为了公平比较,我们使用相同的超参数来微调每个 PLM 的原始版本及其 DC-Match 变体。

实验中,模型分为两组。第一组是传统的神经网络方法,第二组是受益于大规模预训练的 PLMs。我们可以看到,PLMs 的表现优于传统的神经匹配模型。

我们对不同的 PLMs 进行了实验。数据可见,所有 PLMs 的匹配精度在两个数据集上都稳定增加。这表明,通过将匹配问题分解成更容易的子问题,这种分治策略可以有效地给出原问题更好的解决方案。尤其我们可以看到,DC-Match 策略为小数据集 MRPC 带来了更显著的效果提升。这表明关键词和意图的信息是文本语义匹配的重要特征。尤其是当训练数据有限而无法找到有用的潜在模式时。

此外,我们在中文文本匹配数据集 Medical-SM 上评估了我们的方法。Medical-SM 是一个三级分类数据集,也即完全匹配、部分匹配、不匹配。除了 acc 之外,我们还使用 MacroF1 来作为评估指标。从表中看到 DC-Match 仍然提高了 PLMs 的匹配效果,表明我们的策略在多分类场景和不同语言中都是非常有效的。

消融实验

我们通过消融实验来论证每个子模块的有效性。以 roberta 模型为主模型,从图中数据可以得出,在仅添加了关键词和意图识别的远程监督损失 ( Lds) 之后,结果与原始 PLMs 没有显著不同。这反映了该辅助训练目标不能与原始文本匹配问题直接关联,因此 Lds 本身可能对最终目标没有帮助。然而,我们任务中移除 Lds,仅保持分治的训练目标( Ldc),我们观察到与完整的 DC-Match 版本相比,效果有所下降。

这说明,远程监督目标确实有助于模型学会将关键字从意图中分离出来,并获得不同匹配粒度级别的有区别的内容表示,这有助于子问题的解决。

鲁棒性实验

分治策略将关键字从意图中分离出来,为最终的匹配判断提供了额外的可解释性。我们通过进行多中文变化来评估 DC-Match 鲁棒性。我们观察到原始 PLM 和它们的 DC-Match 变体的效果都有所下降。然而,与原始 PLMs 相比,DC-Match 增强后的 PLMs 可以保持更稳定的效果,这表明 DC-Match 可以在一定程度上提高 PLMs 对于文本语义匹配任务的鲁棒性。

关于 QQ 浏览器实验室

QQ 浏览器实验室成立于 2021 年,致力于探索下一代信息与服务获取和交互方式。未来将依靠 AI、搜索、大数据、推荐算法的技术研究,提升信息与服务的获取效率,革新用户与世界的交互方式,成为探索下一代信息与服务获取方式和交互方式的研究平台。

    推荐阅读
  • 偏头痛的原因和治疗方法女性(偏头痛的原因和治疗方法都有哪些)

    引发偏头痛的原因<p气温过高,天气太热都有可能引起偏头痛。但是,一旦开始下雨,气温开始降低的话,偏头痛的发作率就会降低。即便是一些好闻的,香的气味也有可能会导致偏头痛。首先患者可以通过自我按摩缓解偏头痛。不过要注意睡眠时间也不宜过长,避免睡醒偏头痛更剧烈。而且在睡觉的时候,不要采取俯卧的姿势,因为这个姿势会导致我们的脖子肌肉发麻,引发偏头痛。

  • 红烧鸡腿怎么烧 红烧鸡腿怎么烧视频

    再加入葱、姜翻炒,加料酒、生抽、酱油爆香。

  • 世界500强第一竟然是沃尔玛(财富世界500强揭晓)

    沃尔玛连续第九年成为全球最大公司,亚马逊上升至第二位,中国的国家电网公司位居第三位。在盈利方面,沙特阿美公司以约1,054亿美元的利润位居榜首。加上台湾地区企业,中国共有145家公司上榜,大公司数量继续位居各国之首。中国上榜企业利润及其增速远低于美国和世界平均水平。今年进入榜单的中国银行共有10家,这10家银行利润占全部上榜中国大陆企业利润总额的41.7%,上榜银行利润占比仍然很高。同时,榜单上的房地产企业均来自中国。

  • 鸱鸮怎么念(雕鸮的读音和意思)

    雕鸮的读音和意思雕鸮,国家重点保护野生动物、鸮形目鸱鸮科鸟类,很多同学可能没有见过那么,雕鸮两个字怎么读呢?快来看看吧雕鸮怎么读拼音:diāoxiāo雕鸮,属夜行猛禽,喙坚强而钩曲,嘴基蜡膜为硬须掩盖2021年2月,。

  • 踝关节扭伤外踝凸起诊断(踝关节扭伤诊疗指南)

    踝关节不稳定,并且患者不能负重,关节运动功能丧失。发病率最高的是特技飞行、篮球、排球、田径运动和攀岩,而这些运动中起跳后的落地是最为重要的危险因素。踝关节扭伤一周内,OAR是项可靠性高的检查。若疼痛肿胀明显必须制动,也应将制动时间控制在10天以内。其中全关节镜下Latarjet手术、巨大肩袖修复等手术代表关节镜微创技术已跻身国内一流水平。

  • 有快递单号但是没物流信息怎么办(如何解决有快递单号但是没物流信息)

    有快递单号但是没物流信息怎么办快递单号问题:可以看到快递公司的跟踪记录。一般电商卖家发货时都是分批发货,所以在打包时可能会填写快递单号,即点即送货,然后联系快递员提货。注意,很多淘宝卖家都有与快递联系过,手上有相关快递跟踪号,即使不能及时发货,为了稳定卖家,再将单号上传,这就是虚拟发货。

  • 2021苏州东山枇杷采摘旅游线路推荐(东山枇杷采摘攻略)

    苏州火车站乘502路直达东山。东山镇到陆巷古村,可转乘500路公共汽车到达。乘吴中区汽车站往东山镇的中巴,5-10分钟一班。发往东山的车均经过木渎,游客可在木渎直接搭乘中巴前往东山。其中东山镇中心小学、自来水厂、原花果厂地块,可以容纳较多车辆,车主们届时留意下哦。

  • 为什么国产鞋没有气垫(国产鞋究竟行不行)

    轻便弹性好,穿上它公司同事“起飞”了大牌的运动鞋一直致力于减轻鞋子的质量。我们称了一下洲码仕鞋186g,布鞋的重量是382g,洲码仕鞋的质量仅为普通鞋的一半。洲码仕鞋同样使用了2次发泡技术。穿着这款轻便有弹性的鞋,可防护脚和膝盖。结果穿普通鞋脚部的温度为33.8摄氏度,穿洲码仕鞋脚部温度为29.6摄氏度。洲码仕鞋底采用抓爬纹路设计,增加与地面的摩擦力,步行或跑步时安全性加一。在提升透气性方面,这款鞋的鞋垫采用镂空设计。

  • 工业硅项目建设(设计院项目接到手软)

    关于多晶硅扩产,业内争议很大。近两年华陆公司承担的多晶硅设计项目达产后,预计贡献清洁能源年发电约200GW。华陆公司接获项目显示,五家一线多晶硅厂商是扩产重点。根据硅业分会3月份的统计,已公布新建、拟建多晶硅项目的新进企业已有16家,规划产能共计超过170万吨/年。连续上涨近两年后,多晶硅价格何时迎来向下拐点,始终是行业的焦点议题。

  • 齐鲁工业大学18年大学排行榜(那些历史上曾经的一流大学)

    1917年9月,共合医道学堂及师范学校、潍县广文大学迁来济南新校址开学。齐鲁大学全盛时期,老舍、钱穆、顾颉刚、栾调甫、马彦祥、吴金鼎、胡厚宣等学术名家先后在此执教,号称“华北第一学府”,和燕京大学并称“南齐北燕”。齐鲁大学医学院附属医院更名为山东省立二院,后为山东医学院附属医院,2000年后成为山东大学齐鲁医院。