讲师中心微信公众号

首页

文章

后端开发 web前端数据库开发工具 php框架常见问题科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程自媒体新闻

专题

后端开发 web前端数据库开发工具 php框架科技 Java 系统教程电脑教程硬件教程手机教程软件教程游戏教程新闻

AI工具

AI 聊天问答 Agent智能体 AI 文本写作 AI 绘画作图 AI 设计工具 AI 视频创作 AI 音频制作 AI 办公学习 AI 编程开发 Prompt指令

学习

大前端后端开发数据库移动端运维开发计算机基础

编程手册

大前端后端开发数据库移动端运维开发计算机基础

下载

js特效网站源码工具下载类库下载网站素材学习资源插件扩展手机游戏

最近更新

0

0

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

WBOY

发布时间：2023-09-03 13:01:08

|

986人浏览过

|

来源于51CTO.COM

转载

阿里巴巴开源了一个新的大模型，非常令人兴奋~

继通义千问-7B（Qwen-7B）之后，阿里云又推出了大规模视觉语言模型Qwen-VL，并且一上线就直接开源。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL是一种基于通义千问-7B的多模态大模型，具体而言，它支持图像、文本和检测框等多种输入，并且不仅仅可以输出文本，还可以输出检测框

举个例子，我们输入一张阿尼亚的图片，通过问答的形式，Qwen-VL-Chat能够总结图片内容，并且能够准确地定位到图片中的阿尼亚

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

在测试任务中，Qwen-VL展现出了“六边形战士”的实力，在四大类多模态任务的标准英文测评中（Zero-shot Caption/VQA/DocVQA/Grounding）上，都取得了最先进的成果

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

一经开源消息传出，立刻引起了广泛关注

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

让我们一起来看看具体的表现如何吧！

首个支持中文开放域定位的通用模型

首先，让我们来整体看一下Qwen-VL系列模型的特点：

多语言对话：支持多语言对话，端到端支持图片里中英双语的长文本识别；
多图交错对话：支持多图输入和比较，指定图片问答，多图文学创作等；
首个支持中文开放域定位的通用模型：通过中文开放域语言表达进行检测框标注，也就是能在画面中精准地找到目标物体；
细粒度识别和理解：相比于目前其它开源LVLM（大规模视觉语言模型）使用的224分辨率，Qwen-VL是首个开源的448分辨率LVLM模型。更高分辨率可以提升细粒度的文字识别、文档问答和检测框标注。

在不改变原意的情况下，需要重写的内容是：Qwen-VL可以在知识问答、图像问答、文档问答、细粒度视觉定位等场景中使用

例如，有一个外国朋友不懂中文去医院看病，对着导览图感到困惑，不知道如何前往相应的科室，可以直接将图和问题交给Qwen-VL，让它根据图片信息充当翻译

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

再次进行多图输入和比较的测试

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

尽管没有认出阿尼亚，但情绪判断确实相当准确（手动狗头）

在视觉定位能力方面，即使图片非常复杂且人物众多，Qwen-VL仍然可以根据要求准确地找出绿巨人和蜘蛛侠

Explainpaper

Explainpaper

阅读学术论文的更好方法，你的学术论文阅读助手。

下载

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL在技术细节上以Qwen-7B为基座语言模型，并通过引入视觉编码器ViT和位置感知的视觉语言适配器，使得模型能够支持视觉信号输入

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

具体的训练过程分为三步：

预训练：只优化视觉编码器和视觉语言适配器，冻结语言模型。使用大规模图像-文本配对数据，输入图像分辨率为224x224。
多任务预训练：引入更高分辨率（448x448）的多任务视觉语言数据，如VQA、文本VQA、指称理解等，进行多任务联合预训练。
监督微调：冻结视觉编码器，优化语言模型和适配器。使用对话交互数据进行提示调优，得到最终的带交互能力的Qwen-VL-Chat模型。

在Qwen-VL的标准英文测评中，研究人员对四大类多模态任务（Zero-shot Caption/VQA/DocVQA/Grounding）进行了测试

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

根据结果显示，Qwen-VL在与同等尺寸的开源LVLM进行比较时取得了最佳效果

另外，研究人员构建了一套基于GPT-4打分机制的测试集TouchStone。

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

阿里巨型模型再次开源！图像理解与物体识别功能一应俱全，基于通用问题集7B训练，商业应用可行

Qwen-VL-Chat在这项对比测试中取得了最先进技术水平（SOTA）

如果你对Qwen-VL感兴趣，你可以在魔搭社区和huggingface上找到demo来直接试玩。链接在文末提供

Qwen-VL支持研究人员和开发者进行二次开发，并且允许商业使用。但需要注意的是，如果要进行商业使用，需要先填写问卷申请

项目链接：https://modelscope.cn/models/qwen/Qwen-VL/summary
https://modelscope.cn/models/qwen/Qwen-VL-Chat/summary
https://huggingface.co/Qwen/Qwen-VL
https://huggingface.co/Qwen/Qwen-VL-Chat
https://github.com/QwenLM/Qwen-VL

请点击以下链接查看论文：https://arxiv.org/abs/2308.12966

相关文章

5分钟教你用AI生成婚礼流程策划案，备婚新人必备

文心一言 4.0 在公文写作规范中的实战技巧

CanvaAI抠图能否识别产品图_CanvaAI产品图自动抠图与背景替换【教程】

如何用AI自动分析竞争对手 AI市场竞品分析报告生成【教程】

豆包图片生成视频技巧_豆包图片生成视频技巧最牛教程2026最新

相关标签:

通义千问 qwen

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：华为云尤鹏：盘古大模型，共享智慧，服务行业下一篇：AI搜索功能正式加入，文心一言网页版全新上线

作者最新文章

提升效率的夸克浏览器AI搜索_夸克AI搜索高效使用秘籍

2025-10-17 16:12

夸克浏览器AI搜索功能详解_几个实用的夸克AI搜索技巧分享

2025-10-17 17:20

手机版夸克浏览器AI搜索设置_移动端夸克AI搜索使用全攻略

2025-10-17 23:58

夸克浏览器AI搜索深度体验_夸克AI搜索与其他AI的对比

2025-10-18 22:34

夸克浏览器AI搜索入口在哪_一文读懂夸克AI搜索如何激活

2025-10-19 09:25

夸克浏览器如何调用AI搜索_夸克AI搜索的快捷指令大全

2025-10-19 11:02

夸克浏览器一键启用AI搜索_带你体验夸克AI搜索的强大之处

2025-10-19 18:42

玩转夸克浏览器的AI搜索模式_夸克AI搜索新手入门操作指南

2025-10-20 09:50

夸克浏览器AI搜索最新版教学_探索夸克AI搜索的隐藏功能

2025-10-24 20:48

夸克浏览器怎么用AI搜索_夸克AI搜索正确提问方式教学

2025-10-25 23:12

热门AI工具

更多

DeepSeek

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

更多

ip地址修改教程大全

ip地址修改教程大全

本专题整合了ip地址修改教程大全，阅读下面的文章自行寻找合适的解决教程。

33

2025.12.26

压缩文件加密教程汇总

压缩文件加密教程汇总

本专题整合了压缩文件加密教程，阅读专题下面的文章了解更多详细教程。

18

2025.12.26

wifi无ip分配

wifi无ip分配

本专题整合了wifi无ip分配相关教程，阅读专题下面的文章了解更多详细教程。

46

2025.12.26

漫蛙漫画入口网址

漫蛙漫画入口网址

本专题整合了漫蛙入口网址大全，阅读下面的文章领取更多入口。

91

2025.12.26

b站看视频入口合集

b站看视频入口合集

本专题整合了b站哔哩哔哩相关入口合集，阅读下面的文章查看更多入口。

283

2025.12.26

俄罗斯搜索引擎yandex入口汇总

俄罗斯搜索引擎yandex入口汇总

本专题整合了俄罗斯搜索引擎yandex相关入口合集，阅读下面的文章查看更多入口。

370

2025.12.26

虚拟号码教程汇总

虚拟号码教程汇总

本专题整合了虚拟号码接收验证码相关教程，阅读下面的文章了解更多详细操作。

35

2025.12.25

错误代码dns_probe_possible

错误代码dns_probe_possible

本专题整合了电脑无法打开网页显示错误代码dns_probe_possible解决方法，阅读专题下面的文章了解更多处理方案。

25

2025.12.25

网页undefined啥意思

网页undefined啥意思

本专题整合了undefined相关内容，阅读下面的文章了解更多详细内容。后续继续更新。

72

2025.12.25

热门下载

更多

网站特效

/

网站源码

/

网站素材

/

前端模板

相关下载

更多

php商城系统

淘源码商城PHP淘宝查信誉

PHP房产程序[BBWPS]

PHP简约自动发卡平台个人版

ERMEB域名PHP离线网络授权系统

Difeye-敏捷的轻量级PHP框架

大泉州汽车网PHP整站程序

精品课程

更多

相关推荐

/

热门推荐

/

最新课程

Django 教程

Django 教程

共28课时 | 2.5万人学习

Go 教程

Go 教程

共32课时 | 3万人学习

TypeScript 教程

TypeScript 教程

共19课时 | 1.8万人学习

最新文章

更多

如何用AI帮你检查代码中的潜在安全漏洞？

AI简历生成工具有哪些_一键生成专业简历的AI工具推荐

Claude怎么用新功能摘要提取_Claude摘要功能使用【教程】

如何利用文心一言优化知乎高赞回答的逻辑结构

百度AI助手官方入口文心一言网页版登录入口

教你用AI帮你进行论文选题，快速找到有研究价值的方向

怎么用AI帮你写一份客户感谢信？维系客户关系的利器

Gemini 辅助进行博物馆数字化藏品分类建议

5分钟教你用AI生成婚礼流程策划案，备婚新人必备

文心一言 4.0 在公文写作规范中的实战技巧

关于我们免责申明举报中心意见反馈讲师合作广告合作最新更新: php中文网：公益在线php培训，帮助PHP学习者快速成长！; 关注服务号技术交流群

PHP中文网订阅号: 每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号

PHP学习

技术支持

返回顶部