图片、截图、扫描件怎么让 AI 直接读懂?多模态用法实录
【天极网IT新闻频道】
不是所有资料都是可复制的文字。会议白板拍的照片、领导在微信里发的批注截图、扫描版的合同和课件――这些内容用传统方式处理,要么手动敲一遍,要么先过一道识别工具。
Tabbit 浏览器的对话支持多模态理解,图片可以直接上传提问,页面上的内容也能截图后提问。下面按素材类型说用法。
1. 聊天截图:把只言片语转成清单
*典型的场景是收到一段笼统反馈的截图。直接把截图传进对话框,配合相关文档一起提问,让 AI 结合图片里的意见给出具体的修改方向。
Brief 里给的例子很有代表性:同时上传论文文档和导师反馈截图,指令是结合图片中的修改意见深度审阅论文,指出缺少数据佐证的段落并列出需要补充的方向。多模态的价值就在于同时理解图像和长文档,省掉反复揣摩意图的时间。
2. 网页上的图表:用截图提问
如果目标内容就在当前页面上――图表、流程图、排版复杂的表格――不用先另存再上传,点输入框里的截图按钮,选中页面元素或区域后直接提问。
两个细节:截图状态下页面仍然可以滚动,长表格能完整框选;拖拽可以切换为自由选区,按 Esc 退出截图。
3. 素材类图片:批量整理
Brief 里还有一类用法值得知道:面对大量素材链接,开启任务(Agent)模式后,它能自主浏览网页、验证链接有效性,直接列出可用的网站列表,省去逐个点击验证的时间;对话功能的多模态理解也能精准提取图片特征。
配合收藏使用效果更好――网页上的任何图片、图表或文字片段都可以随手右键收藏,不需要保存到本地、新建文件夹、命名文件;AI 会为每个收藏自动生成一句概述直接显示在标题下方。
4. 扫描件和 PDF
扫描版资料通常以 PDF 形态存在。在线和本地 PDF 打开后都能直接对话和划词提问,不需要先做格式转换。
5. 一个使用建议
多模态提问时,指令要比纯文字场景更具体。不要只说「看看这张图」,而是说明你要从图里得到什么――是提取其中的数据、理解流程关系,还是对照另一份材料找差异。图像信息密度高,指令越明确,结果越准。
判断标准很简单:你能看到的,AI 就应该能看到。截图、照片、扫描件不该成为额外的处理成本。
Tabbit 浏览器国内版可在 www.tabbit.com 下载,桌面端与移动端 App 数据云端同步。
类型:广告
免责声明:以上内容为本网站转自其它媒体,相关信息仅为传递更多信息之目的,不代表本网观点,亦不代表本网站赞同其观点或证实其内容的真实性。
