0

0

Yandex 开源 LLM 训练工具节省高达 20% 的 GPU 资源

王林

王林

发布时间:2024-06-12 09:10:13

|

479人浏览过

|

来源于机器之心

转载

yandex跨国科技公司最近推出了yafsdp,这是一种用于训练大型语言模型(llm)的开源方法。yafsdp是目前最有效的公开可用工具,用于增强gpu通信并减少llm训练中的内存使用量,与fsdp相比,其训练速度提升最高可达26%,具体取决于架构和参数数量。通过使用yafsdp,减少llm的训练时间可以节省高达20%的gpu资源。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

Yandex 开源 LLM 训练工具节省高达 20% 的 GPU 资源

Yandex是全球人工智能社区的发展者,将YaFSDP开源提供给全球的LLM开发人员和人工智能爱好者,即是执行此承诺的其中一步。

"目前,我们正在积极尝试各种模型架构和参数大小,以扩展 YaFSDP 的多功能性,"Yandex 高级开发专家、YaFSDP 团队成员 Mikhail Khruschev 指出,"我们很高兴与全球 ML 社区分享我们在 LLM 训练方面的研发成果,希望能为全球研究人员和开发者获得更多的开源工具和更高的效率做出贡献。”

YaFSDP 案例

LLM(机器学习工程师和自主开发)的公司投入了大量的时间和GPU资源(相当于金钱)来训练这些模型。模型越大,其训练所需的时间和费用就越高。

Yandex 的 YaFSDP 优化了学习速度和性能,使全球的 AI 开发人员在训练模型时可以使用更少的计算能力和 GPU 资源。例如,在涉及具有 700 亿个参数之模型的预训练场景中,使用 YaFSDP 可以节省大约 150 个 GPU 的资源,这意味着每月可以节省大约 50 万美元到 150 万美元(取决于虚拟 GPU 提供商或平台)。

千图设计室AI海报
千图设计室AI海报

千图网旗下的智能海报在线设计平台

下载

YaFSDP 通过消除 GPU 通信效率低下来提升效能,确保训练时只需必要的处理器内存,并使 GPU 交互不间断。

YaFSDP 的训练效率

YaFSDP+ 是 FSDP 的增强版,在 LLM 训练中最耗通信的阶段(如预训练、对齐和微调)中,其表现优于 FSDP 方法。YaFSDP 在 Llama 2 和 Llama 3 上展示的最终提速表明训练速度显著提高,在 Llama 2 70B 和 Llama 3 70B 上分别达到 21% 和 26%。

Mikhail Khruschev 表示:“YaFSDP 在 130 亿至 700 亿个参数的模型上表现出色,在 300 亿至 700 亿个参数范围内表现尤为惊人。目前,YaFSDP 最适合基于 LLaMA 架构的广泛使用之开源模型。”

YaFSDP 并不是 Yandex 的第一个开源工具。该公司之前曾分享过其他几款在 ML 社区中很受欢迎的工具,包括:

  • CatBoost一种高性能的基于决策树之梯度提升库。
  • YTsaurus分布式存储和处理的大数据平台。
  • AQLM:最先进的量化算法之一,用于大型语言模型的极限压缩。由 Yandex Research、HSE 大学、 IST Austria 及 NeuralMagic 共同开发。
  • Petals是一个旨在简化 LLM 训练和微调过程的库,由 Yandex Research、HSE 大学、华盛顿大学、Hugging Face、巴黎-萨克雷高等经济学院和 Yandex 数据分析学院合作开发。

相关专题

更多
什么是分布式
什么是分布式

分布式是一种计算和数据处理的方式,将计算任务或数据分散到多个计算机或节点中进行处理。本专题为大家提供分布式相关的文章、下载、课程内容,供大家免费下载体验。

319

2023.08.11

分布式和微服务的区别
分布式和微服务的区别

分布式和微服务的区别在定义和概念、设计思想、粒度和复杂性、服务边界和自治性、技术栈和部署方式等。本专题为大家提供分布式和微服务相关的文章、下载、课程内容,供大家免费下载体验。

229

2023.10.07

页面置换算法
页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章,大家可以免费体验。

389

2023.08.14

人工智能在生活中的应用
人工智能在生活中的应用

人工智能在生活中的应用有语音助手、无人驾驶、金融服务、医疗诊断、智能家居、智能推荐、自然语言处理和游戏设计等。本专题为大家提供人工智能相关的文章、下载、课程内容,供大家免费下载体验。

402

2023.08.17

人工智能的基本概念是什么
人工智能的基本概念是什么

人工智能的英文缩写为AI,是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术及应用系统的一门新的技术科学;该领域的研究包括机器人、语言识别、图像识别、自然语言处理和专家系统等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

291

2024.01.09

人工智能不能取代人类的原因是什么
人工智能不能取代人类的原因是什么

人工智能不能取代人类的原因包括情感与意识、创造力与想象力、伦理与道德、社会交往与沟通能力、灵活性与适应性、持续学习和自我提升等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

620

2024.09.10

Python 人工智能
Python 人工智能

本专题聚焦 Python 在人工智能与机器学习领域的核心应用,系统讲解数据预处理、特征工程、监督与无监督学习、模型训练与评估、超参数调优等关键知识。通过实战案例(如房价预测、图像分类、文本情感分析),帮助学习者全面掌握 Python 机器学习模型的构建与实战能力。

32

2025.10.21

数据分析的方法
数据分析的方法

数据分析的方法有:对比分析法,分组分析法,预测分析法,漏斗分析法,AB测试分析法,象限分析法,公式拆解法,可行域分析法,二八分析法,假设性分析法。php中文网为大家带来了数据分析的相关知识、以及相关文章等内容。

455

2023.07.04

php源码安装教程大全
php源码安装教程大全

本专题整合了php源码安装教程,阅读专题下面的文章了解更多详细内容。

65

2025.12.31

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号