预训练无需注意力，扩展到4096个token不成问题，与BERT相当

WBOY

发布时间：2023-05-08 19:37:08

1323人浏览过

来源于51CTO.COM

转载

Transformer 作为 NLP 预训练模型架构，能够有效的在大型未标记的数据上进行学习，研究已经证明，Transformer 是自 BERT 以来 NLP 任务的核心架构。

最近的工作表明，状态空间模型（SSM）是长范围序列建模有利的竞争架构。SSM 在语音生成和 Long Range Arena 基准上取得了 SOTA 成果，甚至优于 Transformer 架构。除了提高准确率之外，基于 SSM 的 routing 层也不会随着序列长度的增长而呈现二次复杂性。

本文中，来自康奈尔大学、 DeepMind 等机构的研究者提出了双向门控 SSM （BiGS），用于无需注意力的预训练，其主要是将 SSM routing 与基于乘法门控（multiplicative gating）的架构相结合。该研究发现 SSM 本身在 NLP 的预训练中表现不佳，但集成到乘法门控架构中后，下游准确率便会提高。

实验表明，在受控设置下对相同数据进行训练，BiGS 能够与 BERT 模型的性能相匹配。通过在更长的实例上进行额外预训练，在将输入序列扩展到 4096 时，模型还能保持线性时间。分析表明，乘法门控是必要的，它修复了 SSM 模型在变长文本输入上的一些特定问题。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

论文地址：https://arxiv.org/pdf/2212.10544.pdf

方法介绍

SSM 通过以下微分方程将连续输入 u (t) 与输出 y (t) 联系起来：

预训练无需注意力，扩展到4096个token不成问题，与BERT相当

对于离散序列，SSM 参数被离散化，其过程可以近似为：

预训练无需注意力，扩展到4096个token不成问题，与BERT相当

这个方程可以解释为一个线性 RNN，其中 x_k 是一个隐藏状态。y 也可以用卷积计算：

预训练无需注意力，扩展到4096个token不成问题，与BERT相当

Gu 等人展示了一种在神经网络中使用 SSM 的有效方法，他们开发了参数化 A 的方法，称为 HiPPO，其产生了一个稳定而高效的架构，称为 S4。这保留了 SSM 对长期序列建模的能力，同时比 RNN 训练更有效。最近，研究人员提出了 S4 的简化对角化版本，它通过对原始参数更简单的近似实现了类似的结果。在高层次上，基于 SSM 的 routing 为神经网络中的序列建模提供了一种替代方法，而无需二次计算的注意力成本。

预训练模型架构

SSM 能取代预训练中的注意力吗？为了回答这个问题，该研究考虑了两种不同的架构，如图 1 所示的堆叠架构（STACK）和乘法门控架构（GATED）。

具有自注意力的堆叠架构相当于 BERT /transformer 模型，门控架构是门控单元的双向改编，最近也被用于单向 SSM。带有乘法门控的 2 个序列块（即前向和后向 SSM）夹在前馈层中。为了进行公平比较，门控架构的大小保持与堆叠架构相当。

预训练无需注意力，扩展到4096个token不成问题，与BERT相当

图 1：模型变量。STACK 是标准 transformer 架构，GATED 为基于门控单元。对于 Routing 组件（虚线），该研究同时考虑双向 SSM（如图所示）和标准自注意力。门控（X）表示逐元素乘法。

实验结果

预训练

表 1 显示了 GLUE 基准测试中不同预训练模型的主要结果。BiGS 在 token 扩展上复制了 BERT 的准确率。这一结果表明，在这样的计算预算下，SSM 可以复制预训练 transformer 模型的准确率。这些结果明显优于其他基于非注意力的预训练模型。想要达到这个准确率，乘法门控是必要的。在没有门控的情况下，堆叠 SSM 的结果明显更差。为了检查这种优势是否主要来自于门控的使用，本文使用 GATE 架构训练了一个基于注意力的模型；然而，结果显示该模型的效果实际上低于 BERT。

预训练无需注意力，扩展到4096个token不成问题，与BERT相当

表 1：GLUE 结果。（Top）在控制设置下，不同架构和 routing 的比较。参见图 2 了解详细信息。（Bottom) 报告了基于 CNN、LSTM 和 FNet 的其他非注意力预训练模型的可比结果。

绘蛙AI修图

绘蛙平台AI修图工具，支持手脚修复、商品重绘、AI扩图、AI换色

下载

Long-Form 任务

表 2 结果显示，可以将 SSM 与 Longformer EncoderDecoder (LED) 和 BART 进行比较，但是，结果显示它在远程任务中表现得也不错，甚至更胜一筹。与其他两种方法相比，SSM 的预训练数据要少得多。即使 SSM 不需要在这些长度上进行近似，长格式也依旧很重要。

预训练无需注意力，扩展到4096个token不成问题，与BERT相当

表 2：SCROLLS Encoder 测试结果。基线模型都是编码器 —— 解码器模型，一个基于 Longformer (LED)，另一个基于 BART。输入的长度有截断。

更多内容请查看原论文。

Vidu AI：使用Q1模型轻松创建电影级短片

如何用文心一言写简历快速生成高含金量求职简历方法

汽车“以旧换新”补贴升级：2026年置换最高补1.5万元

银行经理写给银行经理的信：实用模板和关键要素

生成式AI革新客户服务：提升效率与个性化体验

相关标签:

架构 Token 堆 cnn rnn lstm transformer bert nlp https

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：如何合理看待ChatGPT：一位十年符号主义学者深入探讨。下一篇：在面试、英文邮件、直播、周报和简历五个场景下，GPT 3.5系列模型的性价比如何？我们进行了实测并给出了选择指南。

作者最新文章

提升效率的夸克浏览器AI搜索_夸克AI搜索高效使用秘籍

2025-10-17 16:12

夸克浏览器AI搜索功能详解_几个实用的夸克AI搜索技巧分享

2025-10-17 17:20

手机版夸克浏览器AI搜索设置_移动端夸克AI搜索使用全攻略

2025-10-17 23:58

夸克浏览器AI搜索深度体验_夸克AI搜索与其他AI的对比

2025-10-18 22:34

夸克浏览器AI搜索入口在哪_一文读懂夸克AI搜索如何激活

2025-10-19 09:25

夸克浏览器如何调用AI搜索_夸克AI搜索的快捷指令大全

2025-10-19 11:02

夸克浏览器一键启用AI搜索_带你体验夸克AI搜索的强大之处

2025-10-19 18:42

玩转夸克浏览器的AI搜索模式_夸克AI搜索新手入门操作指南

2025-10-20 09:50

夸克浏览器AI搜索最新版教学_探索夸克AI搜索的隐藏功能

2025-10-24 20:48

夸克浏览器怎么用AI搜索_夸克AI搜索正确提问方式教学

2025-10-25 23:12

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

登录token无效

登录token无效解决方法：1、检查token的有效期限，如果token已经过期，需要重新获取一个新的token；2、检查token的签名，如果签名不正确，需要重新获取一个新的token；3、检查密钥的正确性，如果密钥不正确，需要重新获取一个新的token；4、使用HTTPS协议传输token，建议使用HTTPS协议进行传输；5、使用双因素认证，双因素认证可以提高账户的安全性。

6039

2023.09.14

登录token无效怎么办

登录token无效的解决办法有检查Token是否过期、检查Token是否正确、检查Token是否被篡改、检查Token是否与用户匹配、清除缓存或Cookie、检查网络连接和服务器状态、重新登录或请求新的Token、联系技术支持或开发人员等。本专题为大家提供token相关的文章、下载、课程内容，供大家免费下载体验。

781

2023.09.14