OmniParser是微软研究院与微软通用AI团队提出的屏幕解析工具,作用是把用户界面截图转换为结构化的元素列表。[1] 它把可交互图标检测、图标功能描述与文字识别的结果合并,输出叠加边界框和数字编号的截图以及对应的文本语义,使视觉语言模型能够把动作定位到界面中的具体区域。[2] 该工具不依赖HTML或安卓视图层级等界面元数据,可作为插件接入多种现成的视觉语言模型。[3]
定义
OmniParser是一套把界面截图解析为结构化元素的方法,定位为纯视觉的屏幕解析模块。[2] 它针对的问题是:让大模型在操作系统和应用各不相同的环境中充当通用智能体,前提是能够可靠地找出界面中哪些区域可以点击,并理解这些元素的含义。[3]
解析结果被组织成类似文档对象模型的结构,每个条目含有位置、编号和功能说明,另有一张叠加了边界框与编号的截图。[4] 这些内容会被转成文本提示,与截图一同交给大语言模型,由模型据此判断下一步应操作哪个区域。[4]
该项目由微软研究院与微软通用AI团队完成,论文作者为Yadong Lu、Jianwei Yang、Yelong Shen和Ahmed Awadallah。[1]
原理
OmniParser整合三部分输出:经微调的图标检测模型、经微调的图标描述模型以及一个文字识别(OCR)模块。[4] 检测模型在截图上标出可交互图标与按钮的位置,OCR模块给出文字区域,两组框在重叠比例超过90%时被合并去重,随后每个框获得一个唯一的数字编号。[4]
对于检测出的图标,描述模型会生成说明其功能的文字;文字识别结果与图标描述共同构成局部语义,以文本提示的形式与截图一起送入模型。[3] 论文指出,只输入带框与编号的截图容易导致误判,补充图标的局部语义信息能够改善效果。[4]
训练数据包含两个来源:可交互图标检测数据集内有6.7万张截图,取自clueweb数据集中随机抽样的10万个热门网页地址,标注框来自网页的DOM树;图标描述数据集包含约7000组图标与描述的配对。[2]
检测与描述使用的基础模型在不同版本中有所调整。V1版本分别微调YOLOv8与BLIP-2,V2版本的模型库则包含微调的YOLOv8和微调的Florence-2基础模型。[5]
flowchart LR
A[界面截图] --> B[可交互区域检测]
A --> C[文字识别]
B --> D[边界框合并与编号]
C --> D
D --> E[图标功能语义描述]
E --> F[结构化元素与标注截图]
F --> G[大语言模型预测动作]
发展历程
2024年8月1日,论文《OmniParser for Pure Vision Based GUI Agent》在arXiv公开,作者团队来自微软研究院与微软通用AI团队。[1][6]
2024年9月,OmniParser在Windows Agent Arena基准测试上取得当时的最好成绩。同年10月,可交互区域检测模型与图标功能描述模型对外发布,项目自2024年10月29日起登上Hugging Face模型库的趋势榜首位。
2024年11月,V1.5版本发布,改进了高分辨率界面和细小图标的检测,并新增判断每个屏幕元素是否可交互的能力。 微软同期补充了面向Microsoft 365应用的图标数据,并改进了检测区域的去重逻辑。[3]
2025年1月,团队宣布V2版本即将发布,并称该版本在ScreenSpot Pro基准上取得39.5%的结果。
2025年2月,V2权重发布。与上一代相比,V2使用规模更大、更干净的图标描述与定位数据,推理延迟下降约60%,在A100上平均每帧0.6秒、在单张4090上约0.8秒,ScreenSpot Pro上的平均准确率为39.6%。 同期推出的工具OmniTool可在Windows 11虚拟机中把OmniParser与选定的大模型组合成可操作计算机的智能体。
2025年3月,项目开始支持对操作轨迹的本地记录,用于构建训练数据,OmniTool也逐步加入多智能体编排功能。 2026年7月,项目新增了YOLOv9-E交互区域检测器。
应用
OmniParser的主要用途是构建图形用户界面智能体。对于没有资源自行微调模型的开发者,它提供了一种插件式方案,把现成的视觉语言模型改造成界面操作者;论文展示了它与Phi-3.5-V、Llama-3.2-V等模型组合后的性能提升。[3]
由于不依赖HTML或安卓视图层级,该解析能力可以在不同平台与应用上使用,覆盖PC和移动端界面。[2] 论文在ScreenSpot、Mind2Web、AITW等基准上报告了结果,其中在Mind2Web和AITW上,仅输入截图的方案优于需要截图之外额外信息的GPT-4V基线。[3]
配套工具OmniTool提供一个Docker化的Windows 11环境,开箱支持OpenAI的4o、o1、o3-mini,DeepSeek的R1,Qwen的2.5VL以及Anthropic的Computer Use等模型。
微软还将OmniParser v2列入Azure AI Foundry Labs,作为供开发者体验的研究项目之一。[7]
局限
OmniParser只负责把截图转为文本,本身并不检测输入中是否含有有害内容,官方要求使用者保证所提供的输入合法,并在开发可执行智能体时遵循通行的安全规范。
该工具给出的只是从截图中提取的信息,仍需人工判断;官方说明其适用场景是使用者受过负责任的分析训练、具备批判性推理能力的环境。
在使用BLIP-2作为图标描述模型的版本中,模型可能错误推断图标图像中人物的性别、种族、宗教等敏感属性,微软明确不建议将其用于工作场所类场景。[5]
模型权重采用不同的开源许可:图标检测模型沿用原始YOLO模型的AGPL许可,图标描述模型使用MIT许可。
参见
参考资料
- github.io 上的网页 . github.io [引用日期2026-09-29]
- OmniParser for Pure Vision Based GUI Agent . github.io [引用日期2026-09-29]
- OmniParser for Pure Vision-Based GUI Agent . microsoft.com [引用日期2026-09-29]
- OmniParser for Pure Vision Based GUI Agent . arxiv.org [引用日期2026-09-29]
- README . huggingface.co [引用日期2026-09-29]
- Paper page - OmniParser for Pure Vision Based GUI Agent . huggingface.co [引用日期2026-09-29]
- microsoft.com 上的网页 . microsoft.com [引用日期2026-09-29]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-29T08:56:37Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。