当前位置: 网站首页 AI教程资讯 正文

微软公布多模态模型MM-Navigator,基于GPT-4V研发

来源:互联网 发布时间:2025-07-20

据Arxiv页面显示,微软近日联手加州大学等高校,共同发布一款多模态大模型产品MM-Navigator。

MM-Navigator基于GPT-4V打造,可用于零镜头智能手机GUI导航任务。通过使用MM-Navigator,智能手机屏幕可以像人类用户一样进行交互,并确定后续行动以完成给定的指示。

研究发现,多模态大模型在零镜头GUI导航方面表现出色,尤其是GPT-4V,它具有先进的屏幕解释、行动推理和精确行动定位能力。

相关信息