0

0

ICLR 2025|大模型也需要好奇心,TeleAI 提出探索驱动的对齐方法,8B越级胜70B

聖光之護

聖光之護

发布时间:2025-01-30 20:42:10

|

499人浏览过

|

来源于php中文网

原创

基于探索驱动的大模型对齐方法copo:赋予llm探索能力,突破性能边界

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

图片

AIxiv专栏持续报道全球顶尖AI研究成果。 如果您有优秀的研究成果,欢迎投稿至liyazhou@jiqizhixin.com或zhaoyunfeng@jiqizhixin.com。

自然界生物的探索精神驱动着进化,人类亦是如此。 在人工智能领域,尤其大型语言模型(LLM)的研究中,赋予LLM类似的探索能力,是突破其现有能力边界,提升性能和安全性的关键。

中国电信人工智能研究院(TeleAI)院长李学龙教授团队,联合清华大学、香港城市大学等机构,基于全模态星辰大模型体系,提出了一种新型探索驱动的大模型对齐方法——Count-based Online Preference Optimization (COPO)。 COPO将人类的探索本能融入LLM的后训练(Post-Training)阶段,引导模型在人类反馈强化学习(RLHF)框架下主动探索未知知识,有效解决了现有对齐框架受限于偏好数据集覆盖范围的问题。 该研究为智传网(AI Flow)“基于连接与交互的智能涌现”提供了重要技术支撑,使模型在动态交互中持续学习和进步。 相关论文已被ICLR 2025录用,TeleAI研究科学家白辰甲为第一作者。

图片

研究背景与挑战

尽管LLM在多种语言任务中表现出色,但其与人类价值观和意图的对齐仍面临挑战。 现有的RLHF框架依赖预先收集的偏好数据集,其性能受限于数据集对提示-回复(Prompt-Response)的覆盖范围。 收集高质量偏好数据集成本高昂,且难以覆盖所有可能情况。

因此,研究人员开始探索在线RLHF,让LLM在与语言环境交互中持续学习。 COPO旨在解决在线RLHF中的核心问题:如何高效探索语言空间,以扩大偏好数据覆盖范围。

COPO方法

COPO通过结合基于计数的探索和直接偏好优化(DPO)框架,利用轻量级伪计数模块平衡探索和优化。 该方法在理论上对线性奖励函数和离散状态空间进行了分析,并提供了误差界限和置信集合。

火山写作
火山写作

字节跳动推出的中英文AI写作、语法纠错、智能润色工具,是一款集成创作、润色、纠错、改写、翻译等能力的中英文 AI 写作助手。

下载

COPO的核心在于其探索机制,它通过增加对较少产生的提示-回复组合的对数似然,鼓励模型生成新的回复,从而解决探索-利用权衡问题。 研究证明,COPO算法的在线学习范式能够将总后悔值限制在O(√T)量级。

算法细节

COPO算法框架基于DPO,将乐观探索项转化为基于状态-动作计数的学习目标。 由于语言空间的无限性,COPO使用Coin Flipping Network (CFN)来估计“伪计数”,该网络通过一个简单的回归问题来预测基于计数的探索奖励。 CFN利用Rademacher试验来模拟计数,并接受LLM提取的提示-回复对的最后隐藏状态作为输入,输出与状态“伪计数”成反比的预测值。

实验结果与结论

实验在Zephyr-7B和Llama3-8B模型上进行,使用了UltraFeedback 60K偏好数据集和PairRM 0.4B奖励模型。 结果显示,COPO在AlpacaEval 2.0和MT-Bench基准测试中显著提升了模型性能,超越了其他在线对齐方法,并以8B的模型容量超越了许多大体量模型的性能。 这证明了COPO在提升LLM探索能力、扩大数据覆盖范围和优化策略方面的有效性。

团队介绍

李学龙教授,中国电信集团CTO、首席科学家、TeleAI院长,主要关注大模型、智能光电、临地安防和智传网(AI Flow)。

图片

相关专题

更多
counta和count的区别
counta和count的区别

Count函数用于计算指定范围内数字的个数,而CountA函数用于计算指定范围内非空单元格的个数。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

191

2023.11.20

页面置换算法
页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章,大家可以免费体验。

378

2023.08.14

人工智能在生活中的应用
人工智能在生活中的应用

人工智能在生活中的应用有语音助手、无人驾驶、金融服务、医疗诊断、智能家居、智能推荐、自然语言处理和游戏设计等。本专题为大家提供人工智能相关的文章、下载、课程内容,供大家免费下载体验。

390

2023.08.17

人工智能的基本概念是什么
人工智能的基本概念是什么

人工智能的英文缩写为AI,是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学;该领域的研究包括机器人、语言识别、图像识别、自然语言处理和专家系统等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

282

2024.01.09

人工智能不能取代人类的原因是什么
人工智能不能取代人类的原因是什么

人工智能不能取代人类的原因包括情感与意识、创造力与想象力、伦理与道德、社会交往与沟通能力、灵活性与适应性、持续学习和自我提升等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

617

2024.09.10

Python 人工智能
Python 人工智能

本专题聚焦 Python 在人工智能与机器学习领域的核心应用,系统讲解数据预处理、特征工程、监督与无监督学习、模型训练与评估、超参数调优等关键知识。通过实战案例(如房价预测、图像分类、文本情感分析),帮助学习者全面掌握 Python 机器学习模型的构建与实战能力。

32

2025.10.21

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1502

2024.08.16

JavaScript ES6新特性
JavaScript ES6新特性

ES6是JavaScript的根本性升级,引入let/const实现块级作用域、箭头函数解决this绑定问题、解构赋值与模板字符串简化数据处理、对象简写与模块化提升代码可读性与组织性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

0

2025.12.24

php框架基础知识汇总
php框架基础知识汇总

php框架是构建web应用程序的架构,提供工具和功能,以简化开发过程。选择合适的框架取决于项目需求和技能水平。实战案例展示了使用laravel构建博客的步骤,包括安装、创建模型、定义路由、编写控制器和呈现视图。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1

2025.12.24

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 0.6万人学习

Node.js 教程
Node.js 教程

共57课时 | 7.2万人学习

CSS3 教程
CSS3 教程

共18课时 | 4万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号