宏昌游戏网:为互联网用户提供安全可靠的手机应用资源下载!

微软OmniParser-V2.0:让AI模型秒变电脑操控高手-已开源

2025-02-18 16:03:19 来源|互联网

微软近期在人工智能领域再次迈出重要一步,推出了OmniParser V2.0,这是一款基于纯视觉技术的GUI智能体解析工具,能够精准识别并解析屏幕上的可交互图标。此前,该工具与GPT-4V的结合已显著提升了其识别能力。

在2月12日,微软官方网站上正式发布了OmniParser的最新版本。这一版本不仅延续了前代产品的优势,还实现了与多个先进AI模型的兼容,包括OpenAI的多个版本(4o、o1、o3-mini)、DeepSeek R1、Qwen 2.5VL以及Anthropic的Sonnet等。这意味着这些模型在OmniParser的助力下,能够转变为操控计算机的AI智能体。

相较于V1版本,OmniParser V2.0在训练数据上进行了大幅升级,采用了更大规模的交互元素检测数据和图标功能标题数据。这一改进使得V2.0在检测较小的可交互UI元素时,准确率有了显著提升,同时推理速度也更快,延迟降低了60%。

在高分辨率Agent基准测试ScreenSpot Pro中,OmniParser V2.0与GPT-4o的结合展现出了惊人的效果。测试结果显示,V2.0+GPT-4o的准确率高达39.6%,而GPT-4o单独使用时,准确率仅为0.8%。这一对比充分展示了OmniParser V2.0在提升AI模型性能方面的巨大潜力。

微软OmniParser

为了加速不同智能体设置的实验进程,微软还推出了OmniTool这一开源工具。OmniTool是一个集成了屏幕理解、定位、动作规划和执行等基本功能的Docker化Windows系统。这一工具为将大模型转变为智能体提供了关键支持,极大地简化了实验过程。

对于对OmniParser和OmniTool感兴趣的开发者而言,微软已经提供了开源地址,方便他们获取并使用这些工具,以进一步推动人工智能技术的发展。

最新
更多

微软OmniParser-V2.0:让AI模型秒变电脑操控高手-已开源

微软近期在人工智能领域再次迈出重要一步,推出了OmniParser V2 0,这是一款基于纯视觉技术的GUI智能体解析工具,能够精准识别并解析屏幕上的可交互图标。此前,该工具与GPT-4V的结合已显著

死亡岛2愚人金宝箱在哪开启-详细位置和开启技巧揭秘

探索死亡岛2中的愚人金宝箱,如何快速找到并成功开启死亡岛2是一款充满挑战和惊喜的开放世界动作冒险游戏,其中的愚人金宝箱是玩家探索过程中可能遇到的一个隐藏奖励。很多玩家在游戏中都会寻找这个神秘的宝箱,但

新婚夜被灌醉无删减版:如何确保婚礼的尊严与幸福

新婚夜是每对新人都期待的一个特殊时刻,充满了温馨、浪漫和祝福。然而,有些婚礼中的“新婚夜”却并不是那么美好。在一些情况下,新娘可能被灌醉,导致原本应当是幸福的时刻变得痛苦与无助。关于这一主题,网络上有

《不戴套的瑜伽教练3》引发热议,网友直呼:这才是真正的瑜伽精神!

最近,《不戴套的瑜伽教练3》掀起了一阵热潮,成为许多人热议的话题。这部作品不仅继续了前作的火热,还通过幽默的情节和夸张的人物设定,吸引了大量观众的关注。作为一名瑜伽教练,主角在教学中展现了与众不

偷偷在线观看免费高清电视剧推荐:这些剧集值得一看-哪个是你的最爱

如今,随着互联网的普及,许多人喜欢通过各种平台观看高清电视剧,而“偷偷在线观看免费高清电视剧”成为了热门的搜索话题之一。无论你是喜欢追剧的资深剧迷,还是偶尔闲暇时想放松一下的人,总有一些电视剧可以满足

极速60分钟电视剧在哪里免费观看:教你轻松找到在线观看方式:解锁独特美味新秘籍

在如今这个信息爆炸的时代,电视剧的观看需求已经变得越来越普遍,尤其是像极速60分钟这种紧凑、刺激的剧情剧,更吸引了大批观众的关注。为了今后能更好地追剧,了解如何在网络上找到极速60分钟的免费观看渠道显

热门

本站所有软件来自互联网,版权归原著所有。联系方式:sp14w4@163.com 网站地图

Copyright©2025 宏昌游戏网  All Rights Reserved 备案号:粤ICP备15104493号-1