通义开源视觉理解模型Qwen2.5-VL可操控手机、视频通话
创作时间:
作者:
@小白创作中心
通义开源视觉理解模型Qwen2.5-VL可操控手机、视频通话
引用
腾讯
1.
https://new.qq.com/rain/a/20250128A06H0800?media_id=&openApp=false&suid=&web_channel=wap
1月28日,阿里云通义千问开源全新的视觉模型Qwen2.5-VL,推出3B、7B和72B三个尺寸版本,并已在魔搭社区、HuggingFace等平台开源。
其中,旗舰版Qwen2.5-VL-72B在13项权威评测中的得分领先GPT-4o与Claude3.5。新的Qwen2.5-VL能够更准确地解析图像内容,支持超1小时的视频理解,无需微调就可变身为一个能操控手机和电脑的AI视觉智能体(Visual Agents),实现给指定朋友送祝福、电脑修图、手机订票等多步骤复杂操作。
Qwen2.5-VL识别和定位马路上骑摩托车未戴头盔的人。官方供图
通义团队此前曾开源Qwen-VL及Qwen2-VL两代模型,而新的Qwen2.5-VL视觉知识解析能力实现了飞跃,如准确识别和定位马路上骑摩托车未戴头盔的人,或是以多种格式提取发票中的核心信息并做结构化的推理输出。其视频理解能力也得到了增强,可以在视频中搜索具体事件,并对视频的不同时间段进行要点总结,打开摄像头,用户就能与Qwen2.5-VL实时对话。
开发者基于Qwen2.5-VL也能开发属于自己的AI智能体,如自动核验快递单地址与照片中的门牌号是否对应,根据家庭摄像头判断猫咪状况进行自动喂食,自动进行火灾报警等。
热门推荐
绿茶白茶嘌呤含量低,痛风患者饮茶指南
蒲公英茶、绿茶等5种茶饮可辅助降尿酸
中卫市保安员考试报名点汇总
《和平精英》职业联赛选手违规被罚,安全隔离期引发全民关注
阿奇霉素正确用法:剂量、副作用和禁忌全解析
秋冬黑色大衣的N种时髦搭配
杭州女生的冬季穿搭秘籍:黑色大衣的多种搭配方式
一文详解汽车内空气污染:来源、危害与解决方案
吃阿奇霉素期间,多吃橙子真的有用?
阿奇霉素和复方甘草片,这样吃小心心脏受不了!
一周减脂晚餐吃法,瘦了25斤经验分享
饭后腹胀是什么原因?如何治疗?
兼职话术与沟通技巧:六个实用技巧助你提升求职成功率
广西苍梧梅花节:狮寨镇的浪漫之约
解码“美术馆服务标准”:上海如何引领美术馆业发展
孙尚香出装革新:赛场已弃暗影战斧改走影刃流
解码“美术馆服务标准”:上海如何引领美术馆业发展
北京天坛医院专家详解:痴呆症14个危险因素及预防方法
【网络举报】网络不是法外之地!违法和不良信息这么举报
不知火舞VS春丽:格斗女王之争
《拳皇97》不知火舞实战招式大解析
短信加电话,“积分清零”被骗几千,虚拟号码在助纣为虐?
和平精英高手俱乐部招募:从这里开启你的MVP之路!
TT战队阿杰:从普通玩家到三料MVP的电竞传奇
春节年夜饭必备:年糕、麻婆豆腐、清蒸鲈鱼、红烧肉的做法
年糕背后的故事:从伍子胥到各地特色
北京腊八粥:年味儿的开篇
借东西不还真的不犯法?答案令人震惊!
2024年亚太地区举报治理报告
益寿强身膏能治愈心理问题吗?中医专家详解其功效与局限