讲师中心微信公众号

首页

文章

后端开发 web前端数据库开发工具 php框架常见问题科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程自媒体新闻

专题

后端开发 web前端数据库开发工具 php框架科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程新闻

AI工具

AI 聊天问答 Agent智能体 AI 文本写作 AI 绘画作图 AI 设计工具 AI 视频创作 AI 音频制作 AI 办公学习 AI 编程开发 Prompt指令

学习

大前端后端开发数据库移动端运维开发计算机基础

编程手册

大前端后端开发数据库移动端运维开发计算机基础

下载

js特效网站源码工具下载类库下载网站素材学习资源插件扩展手机游戏

最近更新

0

0

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

王林

发布时间：2024-06-03 21:04:01

|

508人浏览过

|

来源于51CTO.COM

转载

无情戳穿“长上下文”大模型的虚标现象——

英伟达新研究发现，包括GPT-4在内的10个大模型，生成达到128k甚至1M上下文长度的都有。

但一番考验下来，在新指标“有效上下文”上缩水严重，能达到32K的都不多。

新基准名为RULER，包含检索、多跳追踪、聚合、问答四大类共13项任务。RULER定义了“有效上下文长度”，即模型能保持与Llama-7B基线在4K长度下同等性能的最大长度。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

这项研究被学者评价为“非常有洞察力”。

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

不少网友看到这项新研究后，也非常想看到上下文长度王者玩家Claude和Gemini的挑战结果。（论文中并未覆盖）

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

一起来看英伟达是如何定义“有效上下文”指标的。

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

测试任务更多、更难

要评测大模型的长文本理解能力，得先选个好标准，现圈内流行的ZeroSCROLLS、L-Eval、LongBench、InfiniteBench等，要么仅评估了模型检索能力，要么受限于先验知识的干扰。

所以英伟达剔除的RULER方法，一句话概括就是“确保评估侧重于模型处理和理解长上下文的能力，而不是从训练数据中回忆信息的能力”。

RULER的评测数据减少了对“参数化知识”的依赖，也就是大模型在训练过程中已经编码到自身参数里的知识。

具体来说，RULER基准扩展了流行的“大海捞针”测试，新增四大类任务。

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

检索方面，从大海捞针标准的单针检索任务出发，又加入了如下新类型：

多针检索（Multi-keys NIAH, MK-NIAH）：上下文中插入多个干扰针，模型需检索指定的那一个
多值检索（Multi-values NIAH, MV-NIAH）：一个键（key）对应多个值（values），模型需要检索出与特定键关联的所有值。
多查询检索（Multi-queries NIAH, MQ-NIAH）：模型需根据多个查询在文本中检索出相应的多个针。

除了升级版检索，RULER还增加了多跳追踪（Multi-hop Tracing）挑战。

具体来说，研究人员提出了变量追踪（VT），模拟了指代消解（coreference resolution）的最小任务，要求模型追踪文本中变量的赋值链，即使这些赋值在文本中是非连续的。

挑战第三关是聚合（Aggregation），包括：

常见词汇提取（Common Words Extraction, CWE）：模型需要从文本中提取出现次数最多的常见词汇。
频繁词汇提取（Frequent Words Extraction, FWE）：与CWE类似，但是词汇的出现频率是根据其在词汇表中的排名和Zeta分布参数α来确定的。

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

挑战第四关是问答任务（QA），在现有阅读理解数据集（如SQuAD）的基础上，插入大量干扰段落，考查长序列QA能力。

各模型上下文实际有多长？

实验阶段，如开头所述，研究人员评测了10个声称支持长上下文的语言模型，包括GPT-4，以及9个开源模型开源模型Command-R、Yi-34B、Mixtral（8x7B）、Mixtral（7B）、ChatGLM、LWM、Together、LongChat、LongAlpaca。

Change Style AI

Change Style AI

多风格照片生成器！AI生成30种照片

下载

这些模型参数规模范围从6B到采用MoE架构的8x7B不等，最大上下文长度从32K到1M不等。

在RULER基准测试中，对每个模型评测了13个不同的任务，覆盖4个任务类别，难度简单到复杂的都有。对每项任务，生成500个测试样例，输入长度从4K-128K共6个等级（4K、8K、16K、32K、64K、128K）。

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

为了防止模型拒绝回答问题，输入被附加了answer prefix，并基于recall-based准确性来检查目标输出的存在。

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

研究人员还定义了“有效上下文长度”指标，即模型在该长度下能保持与基线Llama-7B在4K长度时的同等性能水平。

为了更细致的模型比较，使用了加权平均分数（Weighted Average, wAvg）作为综合指标，对不同长度下的性能进行加权平均。采用了两种加权方案：

wAvg(inc)：权重随长度线性增加，模拟以长序列为主的应用场景
wAvg(dec):权重随长度线性减小，模拟以短序列为主的场景

来看结果。

普通大海捞针和密码检索测试看不出差距，几乎所有模型在其声称的上下文长度范围内均取得满分。

而使用RULER，尽管很多模型声称能够处理32K token或更长的上下文，但除了Mixtral外，没有模型在其声称的长度上保持超过Llama2-7B基线的性能。

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

其他结果如下，总的来说，GPT-4在4K长度下表现最佳，并且在上下文扩展到128K时显示出最小的性能下降（15.4%）。

开源模型中排名前三的是Command-R、Yi-34B和Mixtral，它们都使用了较大的基频RoPE，并且比其它模型具有更多的参数。

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

此外，研究人员还对Yi-34B-200K模型在增加输入长度（高达256K）和更复杂任务上的表现进行了深入分析，以理解任务配置和失败模式对RULER的影响。

他们还分析了训练上下文长度、模型大小和架构对模型性能的影响，发现更大的上下文训练通常会带来更好的性能，但对长序列的排名可能不一致；模型大小的增加对长上下文建模有显著好处；非Transformer架构（如RWKV和Mamba）在RULER上的表现显著落后于基于Transformer的Llama2-7B。

更多细节，感兴趣的家银们可以查看原论文。

论文链接：https://arxiv.org/abs/2404.06654

相关文章

创客贴AI智能排版怎样制作邀请函_创客贴AI智能排版邀请函模板与编辑【步骤】

易企秀AI智能排版如何添加视频背景_易企秀AI智能排版视频背景插入与播放设置【步骤】

豆包AI支持哪些文件格式豆包AI文件处理能力详细说明

微信AI数字人能否自动回复好友_微信AI数字人自动回复设置与规则【方法】

5分钟教你用AI为你的宠物写一篇有趣的第一人称日记

数码产品性能查询

数码产品性能查询

该软件包括了市面上所有手机CPU，手机跑分情况，电脑CPU，电脑产品信息等等，方便需要大家查阅数码产品最新情况，了解产品特性，能够进行对比选择最具性价比的商品。

下载

相关标签:

英伟达 gemini claude 架构 Token transformer https gpt llama

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：ASQuery：基于Query的时序动作分割新架构下一篇：ICML2024高分！魔改注意力，让小模型能打两倍大的模型

作者最新文章

告别繁琐手动创建！MezzioTooling助你高效构建现代PHP应用

2025-09-15 11:32

如何解决复杂命令行任务的痛点，使用spryker/console让PHP命令开发更高效

2025-09-15 11:55

如何高效且灵活地管理电商订单计算？Spryker/Calculation模块助你一臂之力

2025-09-15 12:32

如何高效集成在线支付功能？Composer与iyzico/iyzipay-php助你轻松搞定！

2025-09-16 10:12

还在为Magento2慢吞吞的搜索发愁？AlgoliaSearch&Discovery助你打造闪电般的用户体验！

2025-09-16 10:34

如何解决电商库存管理混乱难题？Spryker/Stock模块助你轻松搞定！

2025-09-16 11:12

快速上手夸克浏览器AI搜索_夸克AI搜索保姆级图文教程

2025-10-14 20:48

夸克浏览器AI搜索无法使用_解决夸克AI搜索问题的有效方法

2025-10-15 14:04

夸克浏览器AI搜索设置教程_夸克AI搜索功能详细开启步骤

2025-10-18 13:32

夸克浏览器AI搜索结果不准_优化夸克AI搜索设置的技巧

2025-10-26 10:58

热门AI工具

更多

DeepSeek

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

更多

登录token无效

登录token无效

登录token无效解决方法：1、检查token的有效期限，如果token已经过期，需要重新获取一个新的token；2、检查token的签名，如果签名不正确，需要重新获取一个新的token；3、检查密钥的正确性，如果密钥不正确，需要重新获取一个新的token；4、使用HTTPS协议传输token，建议使用HTTPS协议进行传输；5、使用双因素认证，双因素认证可以提高账户的安全性。

6029

2023.09.14

登录token无效怎么办

登录token无效怎么办

登录token无效的解决办法有检查Token是否过期、检查Token是否正确、检查Token是否被篡改、检查Token是否与用户匹配、清除缓存或Cookie、检查网络连接和服务器状态、重新登录或请求新的Token、联系技术支持或开发人员等。本专题为大家提供token相关的文章、下载、课程内容，供大家免费下载体验。

778

2023.09.14

token怎么获取

token怎么获取

获取token值的方法：1、小程序调用“wx.login()”获取临时登录凭证code，并回传到开发者服务器；2、开发者服务器以code换取，用户唯一标识openid和会话密钥“session_key”。想了解更详细的内容，可以阅读本专题下面的文章。

1044

2023.12.21

token什么意思

token什么意思

token是一种用于表示用户权限、记录交易信息、支付虚拟货币的数字货币。可以用来在特定的网络上进行交易，用来购买或出售特定的虚拟货币，也可以用来支付特定的服务费用。想了解更多token什么意思的相关内容可以访问本专题下面的文章。

1064

2024.03.01

http与https有哪些区别

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

1551

2024.08.16

虚拟号码教程汇总

虚拟号码教程汇总

本专题整合了虚拟号码接收验证码相关教程，阅读下面的文章了解更多详细操作。

30

2025.12.25

错误代码dns_probe_possible

错误代码dns_probe_possible

本专题整合了电脑无法打开网页显示错误代码dns_probe_possible解决方法，阅读专题下面的文章了解更多处理方案。

20

2025.12.25

网页undefined啥意思

网页undefined啥意思

本专题整合了undefined相关内容，阅读下面的文章了解更多详细内容。后续继续更新。

37

2025.12.25

word转换成ppt教程大全

word转换成ppt教程大全

本专题整合了word转换成ppt教程，阅读专题下面的文章了解更多详细操作。

6

2025.12.25

热门下载

更多

网站特效

/

网站源码

/

网站素材

/

前端模板

相关下载

更多

php商城系统

淘源码商城PHP淘宝查信誉

PHP房产程序[BBWPS]

PHP简约自动发卡平台个人版

ERMEB域名PHP离线网络授权系统

Difeye-敏捷的轻量级PHP框架

大泉州汽车网PHP整站程序

精品课程

更多

相关推荐

/

热门推荐

/

最新课程

Django 教程

Django 教程

共28课时 | 2.5万人学习

Go 教程

Go 教程

共32课时 | 3万人学习

TypeScript 教程

TypeScript 教程

共19课时 | 1.8万人学习

最新文章

更多

即梦AI怎么生成短视频脚本_即梦AI脚本生成步骤与情节设定方法【指南】

ChatGPT 辅助进行产品需求文档（PRD）撰写

怎么用AI帮你进行公司年度报告的关键信息提取？

通义听悟怎么用_通义听悟使用方法详细指南【教程】

教你用AI一键生成装修物料清单和预算表，装修小白必备

如何用Claude分析财报数据 Claude金融文书阅读指南

Claude帮你创作深度剧本和小说 Claude复杂情节构思

如何通过 ChatGPT 学习掌握日语语法重点

PicMonkeyAI排版如何去除图片背景_PicMonkeyAI排版抠图工具使用与优化【方法】

如何用ChatGPT写出完美的求职信？一步步教你搞定

关于我们免责申明举报中心意见反馈讲师合作广告合作最新更新: php中文网：公益在线php培训，帮助PHP学习者快速成长！; 关注服务号技术交流群

PHP中文网订阅号: 每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号

PHP学习

技术支持

返回顶部