当前位置: 首页 > news >正文

安卓手机网站开发国外木屋建设网站

安卓手机网站开发,国外木屋建设网站,做搬家广告哪家网站有优,网站开发中安全性的防范探究Attention机制和意力的起源。 简介 在这篇博文[1]中#xff0c;将讨论注意力机制的起源#xff0c;然后介绍第一篇将注意力用于神经机器翻译的论文。由于上下文压缩、短期记忆限制和偏差#xff0c;具有 2 个 RNN 的 Seq2Seq 模型失败了。该模型的 BLEU 分数随着序列长度… 探究Attention机制和意力的起源。 简介 在这篇博文[1]中将讨论注意力机制的起源然后介绍第一篇将注意力用于神经机器翻译的论文。由于上下文压缩、短期记忆限制和偏差具有 2 个 RNN 的 Seq2Seq 模型失败了。该模型的 BLEU 分数随着序列长度的增加而不断降低。 上图显示随着句子长度的增加具有 2 个 RNN 的 Seq2Seq 模型会急剧失败。它无法捕获大序列中的所有相关信息。这个问题催生了Attention机制。事实上注意力的起源可以追溯到很久以前这次我们学习了如何用数学方式表达它并将其用于机器翻译。 注意力机制的起源 如果我们能抛开一切专注于我们的眼睛是如何工作的我们就很容易找到注意力机制的起源。我们可以看到面前的多个物体但我们会同时关注一个物体。这是我们的注意力提示。我们更重视一些感官输入而不太重视某些感觉输入。我们可以使用非意志和意志提示来选择注意力的焦点。非意志线索基于环境中物体的显着性和显着性。使用基于变量选择标准的意志提示这种形式的注意力更加刻意。随着受试者的自愿努力它也会变得更加强大。 查询、键和值 让我介绍一下查询、键和值的概念。在注意力机制的背景下我们将意志线索称为查询。给定任何查询注意力机制会通过注意力池对感觉输入进行偏向选择。这些感官输入在注意力机制的背景下称为值。更一般地说每个值都与一个键配对可以将其视为该感官输入的非意志提示。 注意力集中 注意力池是指对注意力机制产生的注意力权重中包含的信息进行聚合或总结的过程。注意力评分函数用于根据输入序列的不同部分与当前解码步骤的相关性为其分配权重或分数。 上图所示的机制是对于特定查询我们通过使用注意力评分函数来计算其与所有键的相关性。然后我们应用 softmax 运算来获得概率分布注意力权重。稍后我们根据这些注意力权重计算这些值的加权和。 注意力评分函数 有不同类型的注意力评分函数。有加性注意力、乘性注意力和缩放点积注意力。 Bahdanau 使用附加注意力作为评分函数。所以我将在这里讨论它。缩放点积将在下一篇基于“Attention is all you need”论文的博客文章中进行解释。当查询和键是不同长度的向量时我们使用附加注意力作为评分函数。 给定一个查询 (q) 和一个键 (k)加性注意力评分函数首先连接 Wq 和 Wk。然后将其输入具有单个隐藏层的 MLP其隐藏单元的数量为 h一个超参数。 Tanh 用作激活函数偏置项被禁用。 Bahdanau Attention Bahdanau 注意力及其附加注意力公式成为一种强大且广泛采用的注意力机制。它提供了捕获解码器和编码器状态之间复杂对齐的灵活性使模型能够生成更准确和上下文感知的序列。这种架构允许模型自动软搜索源句子中与预测目标单词相关的部分。为每个单词分配注意力权重以了解模型应该对每个单词给予多少“注意力”即对于每个单词网络学习一个“上下文” Bahdanau 注意力机制由三个主要组件组成编码器、解码器和注意力评分函数。编码器由双向 RNN 组成解码器由单向 RNN 组成。双向循环神经网络 (BRNN) 是一种 RNN 架构可以向前和向后处理输入序列。它结合来自过去和未来上下文的信息在每个时间步骤进行预测或生成输出使模型能够捕获两个方向的依赖关系。上图中BRNN 的隐藏状态用 h(t) 表示单向 RNN 的隐藏状态用 s(t) 表示。 注意力权重 a(t,T) 表示每个编码器隐藏状态与当前解码步骤的相关性。这些注意力分数量化了应该对输入序列的每个部分给予多少注意力。这是由另一个前馈网络计算的。该网络接受编码器和解码器的隐藏状态的输入并输出值 e。然后使用 softmax 函数对注意力分数进行归一化将其转换为概率分布。 softmax 函数确保注意力分数总和为 1从而可以将它们解释为权重或概率。 在上图中上下文向量被计算为编码器隐藏状态的加权和以注意力分数作为权重。然后这个上下文向量被输入到解码器中。上下文向量与解码器先前的隐藏状态连接并且该组合表示用作生成下一个输出标记的输入。 总结 总之注意力机制的起源和 Bahdanau 注意力的引入彻底改变了序列建模和自然语言处理领域。受人类认知过程启发的注意力概念使神经网络能够专注于输入序列的相关部分并在序列生成任务期间做出明智的决策。从注意力机制的早期到 Bahdanau 注意力所带来的突破这一历程为机器翻译、文本摘要、语音识别和其他基于序列的任务的进步铺平了道路。 Reference [1] Source: https://medium.com/zaiinn440/from-seq2seq-to-attention-revolutionizing-sequence-modeling-67282ba82e83 本文由 mdnice 多平台发布
http://www.sadfv.cn/news/164175/

相关文章:

  • 公司网站是用什么软件做flash里面如何做网站链接
  • 门禁考勤网站建设建设网站教程视频视频视频
  • 企业网站源码怎么获取卓智网络科技有限公司
  • 莱州做网站的公司erp软件是干嘛的
  • 当地信息网站建设资质淮安市住房和城乡建设局网站首页
  • 什么是做网站金属行业网站模板下载
  • 手机端网站需要多少钱wordpress菜单默认对游客不显示
  • 江苏建设服务信息网站做网站租服务器
  • 潮州网络推广公司东营网站搜索引擎优化
  • 设计说明书模板seo报价单
  • 制作外贸网站模板网站制作过程流程
  • 涪陵网站设计统计站老站长推荐app视频
  • 营销型网站的缺点廊坊网站建设模板
  • 做网站有名的公司百度云搜索引擎入口官方
  • 高端品牌网站建设服务网站服务器平台
  • 做网站栏目是什么意思做的网站如何发布会
  • 遂宁模板建站公司工程承包商赚钱吗
  • 用asp.net 做网站电子商务实验网站建设实训过程
  • 网站title keywords现在花钱做那个网站好呀
  • 珠海科技网站建设电子商务和网络营销哪个好
  • 网站域名在哪备案网站开发包括哪些
  • 做ppt时网站怎么设计直播带货平台
  • 网站域名空间5个G的多少钱h5做的公司网站
  • 建设银行网站201308网站设计的设计方案
  • 哪个网站做视频赚钱南通制作公司网站
  • 网站支付怎么做的灰色词排名接单
  • 给一个网站风格做定义dw做网站怎么发布
  • 网站文字公告代码阳江彭志雄
  • 怎么做律所的官方网站wordpress 投票 星星
  • 怎么做网站前段wordpress 不能编辑