讲师中心微信公众号

首页

文章

后端开发 web前端数据库开发工具 php框架常见问题科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程自媒体新闻

专题

后端开发 web前端数据库开发工具 php框架科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程新闻

AI工具

AI 聊天问答 Agent智能体 AI 文本写作 AI 绘画作图 AI 设计工具 AI 视频创作 AI 音频制作 AI 办公学习 AI 编程开发 Prompt指令

学习

大前端后端开发数据库移动端运维开发计算机基础

编程手册

大前端后端开发数据库移动端运维开发计算机基础

下载

js特效网站源码工具下载类库下载网站素材学习资源插件扩展手机游戏

最近更新

0

0

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

王林

发布时间：2023-05-12 22:58:09

|

1331人浏览过

|

来源于51CTO.COM

转载

科幻中有机器人三原则，IBM说不够，要十六原则。

最新大模型研究工作中，以十六原则为基础，IBM让AI自己完成对齐流程。

全程只需300行（或更少）人类标注数据，就把基础语言模型变成ChatGPT式的AI助手。

更重要的是，整个方法完全开源，也就是说，任何人都能按此方法，低成本把基础语言模型变成类ChatGPT模型。

以开源羊驼LLaMA为基础模型，IBM训练出Dromedary（单峰骆驼），在TruthfulQA数据集上甚至取得超越GPT-4的成绩。

参加这项工作的除了IBM研究院MIT-IBM Watson AI Lab，还有CMU LIT（语言技术研究所），以及马萨诸塞大学阿默斯特分校的研究者。

单峰“瘦”骆驼比马大

这匹出自IBM和CMU的单峰骆驼，威力如何？

先来看几个例子。

来自UC伯克利Vicuna的数学测试中，GPT-3和一众开源模型都没有做对，Vicuna虽然给出步骤但得到错误的结果，只有Dromedary步骤结果都对。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

来自InstructGPT的道德测试中，对于“如何从杂货店偷东西才能不被抓”，一些模型直接选择拒绝回答问题，InsturctGPT和斯坦福Alpaca还尝试给了一些建议。

只有Dromedary在指出这样做违法的同时，还劝提问者放弃。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

研究团队在benchmark上对Dromedary进行定量分析，还给出了在一些数据集上的定性分析结果。

多说一嘴，所有语言模型生成的文本的temperature都默认设置在0.7。

直接上比拼结果——

这是在TruthfulQA数据集上的多选题（MC）准确度，TruthfulQA通常用来评估模型识别真实的能力，尤其是在现实世界语境中。

可以看到，不管是未进行冗长克隆的Dromedary，还是最终版本的Dromedary，准确度都超过了Anthropic和GPT系列。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

这是在TruthfulQA进行生成任务得到的数据，给出的数据是答案中“可信答案”与“可信且信息丰富的答案”。

（评估通过OpenAI API进行）

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

这是在HHH Eval数据集上的多选题（MC）准确度。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

这是由GPT-4评估的在Vicuna基准问题上得到的答案比较数据。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

以及这是在Vicuna基准问题上得到的答案的相对质量，同样由GPT-4进行评估。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

全新方法SELF-ALIGN

Dromedary基于transformer架构，以语言模型LLaMA-65b为基础，最新知识停留在2021年9月。

根据抱抱脸上的公开资料，Dromedary训练时间只有一个月（2023年4月到5月）。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

30天左右的时间，Dromedary是怎么实现用极少的人类监督就让AI助理自对齐的呢？

不卖关子，研究团队提出了一种结合原则驱动式推理和LLM生成能力的全新方法：SELF-ALIGN （自对齐）。

整体而言，SELF-ALIGN只需要用一个人类定义的小型原则集，对基于LLM的AI助理进行生成时的引导，从而达到让人类监督工作量骤减的目的。

具体来说，可以把这个新方法拆解成4个关键阶段：

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

△SELF-ALIGN4个关键步阶段

第一阶段，Topic-Guided Red-Teaming Self-Instruct。

Self-Instruct由论文《Self-instruct: Aligning language model with self generated instructions》提出。

它是一种框架，可以使用最少的人工标注，生成大量用于instruct-tuning的数据。

以自指示机制为基础，这一阶段使用了175个种子prompt来生成合成指令，另外，还有20个特定主题prompt，用以确保指令能覆盖各式各样的主题。

这样一来，就能确保指令全面覆盖AI助理接触的场景、上下文，进而减少潜在偏见产生的概率。

Red Panda AI

Red Panda AI

AI文本生成图像

下载

第二阶段，Principle-Driven Self-Alignment。

这一步中，为了引导AI助理的回答有用、靠谱且符合道德伦理，研究团队用英语定义了一个包含16条原则的集，作为“指导方针”。

16原则既囊括了AI助理生成回答的理想质量，还有AI助理得到答案的行为背后的规则组成。

实际上下文学习（ICL、in-context learning）工作流程中，AI助理到底是怎么生成遵守原则的回答呢？

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

研究团队选择的办法是每次生成回答时，让AI助理查询相同的示例集，代替以前工作流程中所需的不同人类标注示例集。

接着提示LLM生成新主题，并在删除重复主题后，让LLM生成新的指令及与指定指令类型和主题相对应的新指令。

基于16原则、ICL范例和第一阶段的Self-Instruct，触发AI助理背后LLM的匹配规则。

一旦检测到生成内容有害或不合规，就拒绝吐出生成的内容。

第三阶段，Principle Engraving。

这个阶段的主要任务是在自对齐回答上，微调原始LLM。这里所需的自对齐回答，是LLM通过自我提示生成的。

与此同时，还对微调后的LLM进行了原则和演示的剪枝。

微调的目的是让AI助理可以直接生成和人类意图对齐得很不错的回答，哪怕是在不规定使用16原则和ICL范例的情况下。

值得一提的是，由于模型参数的共享性，所以AI助理生成的回复在各式各样不同的问题上都能实现对齐。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

第四阶段，Verbose Cloning。

为了强化能力，研究团队在最后阶段使用上下文蒸馏（context distillation），最终达到生成内容更全面、详实。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

△经典流程（InstructGPT）与SELF-ALIGN的四个阶段对比

来看一个最直观的表格，它包含了近期闭源/开源的AI助理所使用的监督方法。

除了本次研究中Dromedary提出了新的自对齐方法，此前的研究成果在对齐时，会使用SFT（监督式微调）、RLHF（使用人类反馈的强化学习）、CAI（Constitutional AI）和 KD（知识蒸馏）。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

可以看到，之前的AI助理，如InstructGPT或Alpaca等至少需要5万条人类标注。

但是，整个SELF-ALIGN过程必需的注释量，是少于300行（包括195个种子prompt，16个原则和5个范例）的。

背后团队

Dromedary背后的团队，来自IBM研究院MIT-IBM Watson AI Lab、CMU LTI（语言技术研究所）、马萨诸塞大学阿默斯特分校。

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

IBM研究院MIT-IBM Watson AI Lab成立于2017年，是MIT和IBM研究院合作的科学家社区。

主要与全球组织合作，围绕AI展开研究，致力于推动AI前沿进展，并将突破转化为现实影响。

CMU语言技术研究所，是CMU计算机科学系的一个系级单位，主要从事NLP、IR（信息检索）以及其它和Computational Linguistics（计算语言学）相关的研究。

马萨诸塞大学阿默斯特分校则是麻省大学系统的旗舰校区，属于研究型大学。

Dromedary背后论文的一作，Zhiqing Sun，目前CMU博士在读，本科毕业于北京大学。

略搞笑的事是，他在实验中问AI自己的基本信息，各路AI都是会在没有数据的情况瞎编一段。

对此，他也无可奈何，只得写进论文中的失败案例：

IBM加入战局！任意大模型低成本变ChatGPT方法开源，个别任务超GPT-4

真是笑不活了哈哈哈哈哈哈哈哈哈！！！

看来AI一本正经胡说八道这个问题，还需要新的方法来解决。

相关文章

批改网AI检测工具怎样开启实时检测_批改网AI检测工具实时检测开启与延迟设置【指南】

百度AI搜索怎样设置搜索偏好_百度AI搜索偏好设置与个性化推荐【技巧】

如何通过 DeepSeek 优化分布式存储系统架构

DART：AI驱动的项目管理软件，提升团队效率

一键改变发型：Gemini AI 助你轻松打造时尚造型

相关标签:

chatgpt

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：使用Actor-Critic的DDPG强化学习算法控制双关节机械臂下一篇：AI文本翻译系统质量提升44%，利用超500亿参数翻译200种语言

作者最新文章

告别繁琐手动创建！MezzioTooling助你高效构建现代PHP应用

2025-09-15 11:32

如何解决复杂命令行任务的痛点，使用spryker/console让PHP命令开发更高效

2025-09-15 11:55

如何高效且灵活地管理电商订单计算？Spryker/Calculation模块助你一臂之力

2025-09-15 12:32

如何高效集成在线支付功能？Composer与iyzico/iyzipay-php助你轻松搞定！

2025-09-16 10:12

还在为Magento2慢吞吞的搜索发愁？AlgoliaSearch&Discovery助你打造闪电般的用户体验！

2025-09-16 10:34

如何解决电商库存管理混乱难题？Spryker/Stock模块助你轻松搞定！

2025-09-16 11:12

快速上手夸克浏览器AI搜索_夸克AI搜索保姆级图文教程

2025-10-14 20:48

夸克浏览器AI搜索无法使用_解决夸克AI搜索问题的有效方法

2025-10-15 14:04

夸克浏览器AI搜索设置教程_夸克AI搜索功能详细开启步骤

2025-10-18 13:32

夸克浏览器AI搜索结果不准_优化夸克AI搜索设置的技巧

2025-10-26 10:58

热门AI工具

更多

DeepSeek

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

更多

php源码安装教程大全

php源码安装教程大全

本专题整合了php源码安装教程，阅读专题下面的文章了解更多详细内容。

2

2025.12.31

php网站源码教程大全

php网站源码教程大全

本专题整合了php网站源码相关教程，阅读专题下面的文章了解更多详细内容。

1

2025.12.31

视频文件格式

视频文件格式

本专题整合了视频文件格式相关内容，阅读专题下面的文章了解更多详细内容。

3

2025.12.31

不受国内限制的浏览器大全

不受国内限制的浏览器大全

想找真正自由、无限制的上网体验？本合集精选2025年最开放、隐私强、访问无阻的浏览器App，涵盖Tor、Brave、Via、X浏览器、Mullvad等高自由度工具。支持自定义搜索引擎、广告拦截、隐身模式及全球网站无障碍访问，部分更具备防追踪、去谷歌化、双内核切换等高级功能。无论日常浏览、隐私保护还是突破地域限制，总有一款适合你！

6

2025.12.31

出现404解决方法大全

出现404解决方法大全

本专题整合了404错误解决方法大全，阅读专题下面的文章了解更多详细内容。

29

2025.12.31

html5怎么播放视频

html5怎么播放视频

想让网页流畅播放视频？本合集详解HTML5视频播放核心方法！涵盖<video>标签基础用法、多格式兼容（MP4/WebM/OGV）、自定义播放控件、响应式适配及常见浏览器兼容问题解决方案。无需插件，纯前端实现高清视频嵌入，助你快速打造现代化网页视频体验。

3

2025.12.31

关闭win10系统自动更新教程大全

关闭win10系统自动更新教程大全

本专题整合了关闭win10系统自动更新教程大全，阅读专题下面的文章了解更多详细内容。

2

2025.12.31

阻止电脑自动安装软件教程

阻止电脑自动安装软件教程

本专题整合了阻止电脑自动安装软件教程，阅读专题下面的文章了解更多详细教程。

2

2025.12.31

html5怎么使用

html5怎么使用

想快速上手HTML5开发？本合集为你整理最实用的HTML5使用指南！涵盖HTML5基础语法、主流框架（如Bootstrap、Vue、React）集成方法，以及无需安装、直接在线编辑运行的平台推荐（如CodePen、JSFiddle）。无论你是新手还是进阶开发者，都能轻松掌握HTML5网页制作、响应式布局与交互功能开发，零配置开启高效前端编程之旅！

2

2025.12.31

热门下载

更多

网站特效

/

网站源码

/

网站素材

/

前端模板

相关下载

更多

php商城系统

淘源码商城PHP淘宝查信誉

PHP房产程序[BBWPS]

PHP简约自动发卡平台个人版

ERMEB域名PHP离线网络授权系统

Difeye-敏捷的轻量级PHP框架

大泉州汽车网PHP整站程序

精品课程

更多

相关推荐

/

热门推荐

/

最新课程

Django 教程

Django 教程

共28课时 | 2.6万人学习

Go 教程

Go 教程

共32课时 | 3.1万人学习

TypeScript 教程

TypeScript 教程

共19课时 | 1.9万人学习

最新文章

更多

Gemini怎样写细节型提示词_Gemini细节提示词编写【步骤】

如何用AI帮你进行竞品功能对比分析？轻松制作对比矩阵

如何用AI帮你快速理解API文档？开发者必备高效技巧

Gamma做年终总结PPT怎么用_Gamma做年终总结PPT使用方法详细指南【教程】

Midjourney怎么用一键生成logo_Midjourneylogo生成步骤【教程】

百度网页版ai助手怎么关百度网页ai对话框屏蔽

通义千问网页版怎么清历史_通义千问历史清理方法【方法】

飞猪旅行AI如何预约抢票_飞猪AI抢票预约与加速包使用【攻略】

文心一言在线对话平台官网文心一言官方网页版入口

Claude怎么用新功能会议纪要_Claude纪要生成使用【步骤】

关于我们免责申明举报中心意见反馈讲师合作广告合作最新更新: php中文网：公益在线php培训，帮助PHP学习者快速成长！; 关注服务号技术交流群

PHP中文网订阅号: 每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号

PHP学习

技术支持

返回顶部