OpenAI开源Codex Harness:AI编程智能体底层框架向开发者开放
OpenAI近日进一步开放Codex Harness核心能力,将驱动Codex不同产品形态的智能体运行框架正式向开发者开放。Codex Harness并非单纯的代码生成工具,而是完整的Agent执行框架,负责连接模型、用户与工具,管理任务执行、上下文、会话及代码操作等全流程。
从架构看,其核心包括Agent Loop、线程生命周期与持久化、配置及身份认证、工具执行和扩展机制等模块。通过Codex App Server,开发者可使用双向JSON-RPC协议将Harness接入IDE、桌面应用及其他定制化客户端,并获得实时事件流。此前OpenAI已将Codex CLI及相关核心代码开源,并持续完善Harness和App Server能力。目前该框架已支撑Codex Web、CLI、IDE扩展及macOS应用等多种使用场景。
值得关注的是OpenAI分享的内部工程实践:一个产品在约5个月内由Codex编写了约100万行代码,完成约1500个Pull Request,团队核心理念已从"人工编写代码"转向"人类设定目标、Agent执行"。这为外部开发者提供了可参考的工程范式。
开放意味着AI编程竞争正从模型能力延伸至Agent运行时、工具调用、上下文管理和工程反馈闭环。随着底层Harness逐渐标准化,开发者能在Codex核心能力之上构建更专业的软件工程工作流。但也要看到,框架开放不等于开箱即用,实际集成中的调试成本、与现有开发环境的兼容性、以及长期维护的可持续性,都是开发者需要评估的现实问题。生态的繁荣程度,最终取决于社区能不能真正用起来。

阿里开源Qwen-UI-Agent:真机环境测试成功率达92.2%
阿里巴巴正式推出以真实世界为中心的GUI智能体基座模型Qwen-UI-Agent,全面覆盖移动端、电脑端、网页端及深度搜索环境,旨在打破传统模拟测试局限,让模型具备在复杂真实设备上无缝操作的能力。
性能数据方面,该模型在MobileWorld测试中斩获82.1%高分,领先多个国际旗舰模型;在自建百台真机基准MobileWorld-Real上成功率高达92.2%,Android Daily接近满分。电脑端OSWorld-Verified取得79.5%成绩,多项任务相比基线大幅节省执行步数。WebArena网页测试位列所有对比模型第一,通用和Agentic能力全面超越训练基座模型。
为打通"从模拟到真实"的最后一公里,团队搭建了覆盖100多台真实手机、150多个应用的真机移动环境,用于任务构建、轨迹采集及模型训练,并推出包含400多个任务的MobileWorld-Real真机基准。功能上支持GUI界面操作和命令行操作,单次决策可批量输出动作以提升效率。安全机制方面,面对违法或高风险请求直接拒绝终止;涉及支付、数据删除等敏感场景时主动停手等待用户确认。此外支持超100步超长轨迹在线强化学习训练,配合自适应课程学习攻克长程任务。
真机测试的高分确实亮眼,但也要留意测试环境与用户实际使用场景的差异。92.2%的成功率是在受控条件下取得的,日常使用中App更新、系统弹窗、网络波动等变量都可能影响表现。模型开源后,社区的真实反馈才是检验其实用性的关键标尺。
项目地址:

商汤开源8B多模态模型SenseNova U1.5Lite:原生4K输出与视觉编辑
商汤科技宣布开源轻量级原生统一多模态大模型SenseNova U1.5Lite,参数量8B,在多项核心视觉任务中展现超越同量级模型的实力,部分复杂排版与文字渲染达到媲美大规模商业模型的交付水平。
该模型原生支持3至4K上下文长度,能同时处理主体、数量、空间关系、文字、布局及风格等多重约束,显著提升复杂视觉任务执行的稳定性。视觉生成方面,整体构图、色彩、材质、光影、真实感和局部细节均有改善,避免了传统模型常见的"局部正确但整体完成度不足"问题。图像编辑能力增强了对主体身份、空间结构、版式关系及非编辑区域的保持度,局部修改、元素替换、文字精修和多参考图编辑的综合表现全面提升。
文字与复杂布局处理同样亮眼,加强了中英文文字、海报、信息图、品牌视觉及多文本排版能力。视觉控制支持Bounding Box、Visual Marker及单图多图参考等方式,可对指定区域和对象精确编辑。更值得一提的是实现了原生4K高分辨率输出,兼顾宏观构图与极精细肌理、微小文字及光影折射效果。
8B参数量做到这个程度,性价比确实突出。但"轻量"也意味着能力边界更窄,面对极端复杂的工业级需求可能仍需更大模型兜底。开源后开发者能否顺利微调适配自身场景、推理资源消耗是否在可接受范围内,这些实际问题决定了它能不能从"跑分好看"变成"干活好用"。
模型地址:商汤SenseNova官网

豆包上线技能、连接器与工作伙伴,从对话助手转向智能办公平台
豆包工作任务模式近日迎来重磅更新,技能、连接器、工作伙伴三大功能全新上线,协同办公能力再度升级。目前平台已上架超200个技能与连接器,同时支持用户自主创建专属技能,搭建标准化工作流。
技能功能支持沉淀个性化工作方法。比如撰写项目周报时确定的格式和内容规范,可一键保存为个人技能,每周重复复用,固化成熟工作流程。连接器打通豆包与各类办公工具,以飞书连接器为例,接入后可直接在应用内查找资料、处理任务,无需反复切换页面或手动上传文件。工作伙伴提供数据分析、内容策划、科研、金融等多领域专业智能体,用户可按需组建工作小队分工协作完成复杂任务。例如制作数据调研报告时,联动数据、研究、设计类智能体各展所长。
三大功能既可单独使用,也能自由组合:依靠技能留存工作标准,借助连接器调取外部信息,联合不同领域智能体协同落地任务。打开豆包电脑版侧边栏点击「技能·连接器·伙伴」即可体验。
这次更新推动豆包从对话助手转型为智能办公平台。但也要看到,200多个技能和连接器的实际质量参差不齐,用户自建技能的门槛和学习曲线也需要时间消化。工具堆得多不等于效率高,能不能真正嵌入用户的日常工作节奏、减少而非增加操作负担,才是判断这次升级成败的关键。
工具地址:豆包AI官网

千问AI平台接入GLM-5.3与DeepSeek-V4-Pro,模型矩阵持续扩容
阿里云千问AI平台(MaaS)近日更新模型服务矩阵,智谱旗舰大模型GLM-5.3、DeepSeek-V4-Pro正式版完成接入,配套API服务同步对外开放。两款模型均聚焦编程与智能体核心应用场景:GLM-5.3强化编程能力、长程任务执行与网络安全能力;DeepSeek-V4-Pro重点升级智能体交互能力,适配代码开发和多步骤复杂任务处理。
目前千问AI平台已完成多品类主流模型聚合,覆盖文本生成、代码开发、语音处理、图像生成、视频生成五大赛道。平台已接入通义千问Qwen3.8-Max、Qwen3.8开源系列、Qwen Audio3.0、Qwen-Image3.0 Pro、Wan3.0,同时引入GLM-5.3、DeepSeek-V4-Pro、Kimi K3等国内主流模型。开发者可依据业务场景灵活挑选,借助API将AI能力集成至自有应用。
付费层面,平台推出Token Plan套餐服务,DeepSeek-V4-Pro、Qwen3.8-Max、Qwen-Audio系列已开放订阅,用户完成套餐后可在Qoder、Codex等AI开发工具内自由切换模型。
模型聚合平台的价值在于降低选型和切换成本,但也要留意不同模型API的响应速度、并发限制和计费规则差异。对开发者来说,"能用"只是起点,"好用且稳定"才是长期选择的标准。千问平台能否在模型丰富度之外建立起服务和体验的护城河,还需要时间验证。
官网地址:千问AI平台

Grok Build全量上线:自然语言生成应用并支持社交分发
xAI宣布Grok Build正式结束早期测试,面向所有套餐用户开放,全面覆盖网页端、iOS及Android移动端。用户只需在日常对话中用自然语言描述想要的应用、小游戏、网站或数据仪表盘,系统即可在对话界面中实时生成并运行完整版本。
自7月推出早期测试版以来,该功能经历了高速迭代,打通了从创意构思、内容发布到社群分享的完整闭环。发布的应用获得专属grok.me独立链接,支持自由设定访问权限并绑定个人域名,自动生成富预览封面图。分享到X平台时以内联卡片形式展现,允许用户在信息流内直接试玩。
功能扩展方面,应用可直接调用xAI API接入Grok对话、图像生成及语音合成能力,无需管理API密钥。新版本同步推出Remix功能允许二次分叉改造;支持一键导出至GitHub深度开发;引入第三方API密钥管理机制;支持接入核心业务数据打造动态仪表盘。
"人人皆可构建应用"的愿景很吸引人,但也要清醒认识到:自然语言生成的应用复杂度有上限,适合原型验证和轻量工具,离生产级系统还有距离。Remix和GitHub导出降低了二次开发门槛,这是务实的设计。至于生成应用的稳定性和安全性,仍需用户自行把关。工具 democratize 了创造,但没有免除创造者的责任。
详情查看:

雷鸟iO AI眼镜发布:售价2499元,无摄像头设计保障隐私
雷鸟创新在2026新品发布会上推出iO系列首款产品雷鸟iO,定位"人类增强AI眼镜",售价2499元,首发到手价1996元起,支持0至1000度近视配镜,已在京东、天猫、抖音及线下渠道开售。Counterpoint与IDC数据显示,雷鸟2026年第一季度位居中国及全球AR眼镜出货量第一。
硬件方面采用双目显示架构和蓝湖光波导,OC区域透过率93%,非显示区超98%,入眼亮度1800尼特,支持等效33英寸画面及DC调光。整机镁铝合金前框加钛合金镜腿,重量34克,配备体积小于一颗红豆的"萤火光引擎Nano"。支持Smart Crown智能旋钮、点头确认和摇头取消,可显示天气、日程、待办等信息。
AI能力首批接入DeepSeek V4 Pro和千问3.7 Max,后续支持Kimi K3及自研RayNeo AI大模型,续航最长两天。全天候记忆引擎可处理声音、位置等信息形成24小时上下文并自动生成每日总结;实时提示功能识别对话问题并将参考答案显示在镜片上。支持55种语言及109种口音翻译和AI提词器。
隐私方面采用无摄像头设计,录音翻译启动时隐私指示灯同步亮起且无法通过软件关闭。全天智记原始对话先在设备端匿名化脱敏,用户可导出、迁移或彻底删除数据。1996元的首发价和无摄像头的隐私设计是差异化卖点,但AI眼镜的核心体验仍取决于佩戴舒适度和信息呈现的自然感。能不能让用户愿意整天戴着,比参数更重要。

AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:

