人工智能视觉助手在处理复杂任务时,常面临一个关键难题:何时该调用工具,何时该直接回答。北京大学、快手团队、香港科技大学(广州)、中文大学、浙江大学和清华大学的联合研究团队,针对这一问题提出了创新性解决方案。他们开发的Beacon模型通过独特训练机制,使模型能够智能判断是否需要调用工具,显著提升了视觉推理任务的准确性。当前主流的多模态大语言模型虽配备图像裁剪、数值计算等工具,但在实际应用中常出现两种
中国科学技术大学与北京metaStone Technology联合开展的一项研究,为AI角色扮演能力的评估带来了全新思路。该研究以预印本形式发布,论文编号为arXiv:2607.27816v1,为解决AI角色扮演领域长期存在的评测难题提供了创新方案。在AI角色扮演场景中,用户常遇到两种截然不同的体验:有些AI仿佛能精准捕捉用户心思,对话自然流畅;另一些则总像隔着一层薄纱,始终无法真正理解用户意图。
人工智能在视频内容理解领域取得新进展——一支由北京大学、快手Kling团队等顶尖机构组成的研究团队,提出了一种名为RefCaptioner的新型模型,能够精准地将视频描述中的每个词语与对应的参考图片关联起来,解决了长期困扰该领域的关键难题。这项研究的核心挑战在于,当面对一段视频和一组参考图片时,AI需要完成三项复杂任务:首先识别哪些图片实际出现在视频中,哪些是无关干扰项;其次将每张有效图片准确绑定
据行业消息,智谱MaaS开放平台近期用户规模实现显著增长。截至目前,该平台注册用户数已接近700万,较7月初新增约200万,其中企业客户数量达到2.3万家。值得注意的是,其面向开发者的ZCode产品上线仅一个月便突破百万用户,该产品被视为对标国际知名工具Codex的国产解决方案。在商业化进展方面,智谱年度经常性收入(ARR)呈现爆发式增长态势。尽管近期Kimi、阿里等企业相继发布新模型,但智谱的A
近日,谷歌正悄然推进搜索主页的重大改版,部分用户已率先体验到全新设计。此次改版最引人注目的变化是,存在多年的“Google搜索”按钮被移除,取而代之的是三个AI功能快捷入口,标志着谷歌将AI服务置于更核心的位置。新版本在搜索框下方新增了“创建图片”“询问文件”和“头脑风暴”三个按钮。用户点击“创建图片”后,系统会提供生成建议,并通过Nano Banana技术快速生成图像;“询问文件”功能允许用户上
中国电子技术标准化研究院、京东与欣旺达近日在北京达成战略合作,共同成立机器人电池联合实验室。这一合作标志着机器人电池产业正从产品竞争迈向标准化发展新阶段,三方将围绕标准制定、产品开发及测试验证展开深度协同。当前机器人产业呈现爆发式增长,但电池规格不统一的问题日益凸显。不同厂商在电池尺寸、接口设计、通信协议及性能指标上存在差异,导致机器人整机与电池系统的适配成本高企,开发周期延长。以物流机器人为例,
阿里旗下千问平台正式推出开放生态,为手机、PC及AI眼镜开发者提供多终端服务接入能力。该平台通过整合第三方服务资源,构建起覆盖生活消费、本地服务、家庭设备等领域的智能服务网络,用户可在对话交互中直接完成从需求匹配到交易支付的全流程操作。在手机和电脑端应用场景中,平台已接入租房、物流、家政、出行等领域的智能服务体。用户通过输入"@"符号即可唤醒相关服务,或在界面特定位置进入功能模块。以物流服务为例,
当人工智能视觉问答系统给出正确答案时,人们往往容易忽略其推理过程是否可靠。近期,由香港科技大学(广州)、香港大学、清华大学及萨塞克斯大学联合研发的LedgerMind框架,为解决这一核心问题提供了全新思路。该系统通过建立结构化证据台账,确保AI每一步推理都有实际证据支撑,有效遏制了"答案正确但理由虚构"的行业痛点。研究团队发现,当前多模态大语言模型存在四大典型缺陷:答案正确但推理过程掺杂无依据声明
生成式人工智能领域长期面临一个核心挑战:当模型需要从多种可能答案中选择输出时,往往倾向于生成所有选项的模糊平均值。这种现象被称为"模式模糊",导致图像生成结果模糊、文本创作缺乏针对性。伊利诺伊大学厄巴纳-香槟分校与哈佛大学联合研究团队提出全新解决方案,通过引入"探索式建模"机制,成功突破传统训练范式的限制。传统应对策略采用分步生成方式,将复杂任务拆解为多个简单子问题。例如图像生成模型会逐步确定构图
在人工智能领域,大型语言模型的推理速度始终是制约其广泛应用的关键因素之一。传统模式下,这类模型处理输入时如同工人逐件搬运货物,每个词汇的生成都需独立完成,导致整体效率低下。针对这一瓶颈,由科研机构与高校联合组成的研究团队提出了一项名为"投机解码"的创新技术,通过引入辅助模型与主模型的协同机制,显著提升了推理效率。该技术的核心在于构建"辅助-主模型"双轨架构。辅助模型作为轻量级快速响应单元,负责预判
在人工智能视觉领域,通用模型与专业模型的能力互补始终是亟待突破的难题。浙江大学联合多所高校及科研机构的研究团队近日提出名为SpatialCLI的创新训练框架,通过"借用-学习-内化"三阶段策略,成功将专业视觉工具的感知能力迁移至通用模型内部,相关成果以预印本形式发布于学术平台arXiv。传统AI视觉系统存在显著的能力断层:以GPT为代表的通用模型虽具备任务拆解与逻辑推理能力,却无法精准判断物体位置
一项由多家科研机构联合开展的研究,为人工智能领域带来了新的突破。该研究提出了一种名为MemHarness的创新框架,旨在解决当前记忆增强型AI智能体在处理历史经验时面临的困境。这项成果以预印本形式发布,论文编号为arXiv:2607.28272v1,为相关领域的研究提供了新的思路。在日常生活里,人们常遇到这样的情况:朋友曾告知某餐厅停车方便,但当实际前往时,却发现街道正在施工,根本无处停车。这时,
随着大模型参数规模持续扩大,智能体等应用对推理算力的需求呈现爆发式增长,传统以扩大算力规模为主的AI基础设施建设模式正面临成本、能耗与资源利用效率的多重挑战。国家数据局最新数据显示,我国日均Token调用量已突破140万亿,较年初增长超千倍,这一趋势迫使产业界加速探索算法优化、软件重构与新型计算架构等效率提升路径。在众多技术方向中,稀疏计算因其独特的计算优化机制引发关注。该技术通过精准识别并跳过神
最近,硅谷悄然兴起一种看似荒诞的聚会潮流——参与者被要求全程不谈论人工智能(AI)。这些被称为“触草派对”的活动中,人们暂时抛开屏幕,通过触摸真实草地来确认自己仍生活在现实世界。这种行为折射出科技从业者对职业身份的深层焦虑:当AI开始接管人类引以为傲的创造性工作,知识工作者正在经历前所未有的存在危机。在旧金山举办的此类活动中,组织者特意选择远离科技园区的郊外场地。参与者中不乏AI工程师和算法专家,
中国科学院、中国工程院办公厅,中核集团、航天科技、航天科工、航空工业、中国船舶、中国电科、中国航发、中国石油、中国石化、中国海油、国家管网、国家电网、南方电网、中国华能、中国大唐、中国华电、三峡集团、国机集团、鞍钢集团、中国宝武、中铝集团、通用技术集团、中国商飞、中国机械总院、中国钢研、中国有色集团、中国稀土集团、中国有研、中国中车、中广核、中国电气装备、中国中检办公室(综合管理部门),各省、自治
AI报告
电话咨询
在线咨询