歌尔牵头制定虚拟现实设备音频质量测量行业标准正式发布 ;字节跳动研发空间视频生成AI模型,张一鸣亲自督战

看日报是个好习惯

歌尔牵头制定虚拟现实设备音频质量测量行业标准正式发布 Dimenso完成60万欧元融资,将AI眼镜引入实验室场景 Meta实时语音模型支持20+说话人识别,进一步适配AI眼镜 AR超表面光波导厂商阿法龙完成超亿元B轮融资 字节跳动研发空间视频生成AI模型,张一鸣亲自督战 三星将下架两款手机AR应用,“Quick Measure”和“AR Doodle”应用终止服务 Meta遭集体诉讼,被指利用社交平台照片训练AI眼镜人脸识别系统

▍歌尔牵头制定虚拟现实设备音频质量测量行业标准正式发布
9月8日,歌尔股份官方宣布,由其牵头制定的电子行业标准SJ/T 12302-2026《虚拟现实设备音频质量客观测量方法》近日正式发布。该标准由全国音频、视频及多媒体系统与设备标准化技术委员会归口,主要面向虚拟现实(VR)设备音频质量的客观评价。

据介绍,该标准针对VR设备的核心使用场景,重点规范了媒体播放和语音通话两类典型场景下的音频质量客观测量方法,并对测试指标、测试环境、测量流程及判定依据进行了统一规定。
歌尔表示,该标准填补了VR设备音频质量客观评价领域的标准空白,为不同VR设备的音频性能测试和评价提供统一依据。
歌尔长期布局声学及XR相关技术,并参与国家及行业标准制定。此次行业标准发布后,公司还将继续推动VR、声学感知等领域相关技术成果的标准化。
▍Dimenso完成60万欧元融资,将AI眼镜引入实验室场景
近日,西班牙初创公司Dimenso完成一笔60万欧元早期融资,本轮由Draper B1领投,Next Tier Ventures参投。公司主要利用AI与智能眼镜,帮助科研人员在实验室中自动记录、整理和分析实验过程。

据介绍,科研人员或实验室操作人员佩戴智能眼镜后,可通过语音和计算机视觉实时记录实验信息。Dimenso的系统能够识别实验过程中的错误和偏差,并将每次操作整理为可追溯的数据,再交由AI进一步分析并提出假设或下一步建议。
Dimenso称,其平台可将实验数据分析速度提升最高约20倍,同时将文档记录及行政工作时间减少约65%。公司希望解决实验室中仍大量依赖手工记录、信息分散的问题,减少因实验错误导致的重复操作和研发延误。
本轮融资将主要用于加快Dimenso在生物技术和制药行业的落地,并进一步完善其科研工作数据采集和分析基础设施。目前,公司已与美国和西班牙的生物科技、制药企业及学术机构展开合作。
Dimenso总部业务布局延伸至美国马萨诸塞州剑桥Kendall Square,其两位创始人Luis Alvear和Álvaro Buitrago此前拥有Tesla、Harvard Medical School等机构相关经历。
▍Meta实时语音模型支持20+说话人识别,进一步适配AI眼镜
近日,Meta发布实时音频感知模型Muse Voice Transcribe,这是Meta Superintelligence Labs推出的首个实时语音转写模型。该模型会将输入音频切分为80毫秒片段,并在每个片段结束时判断是继续等待上下文,还是立即输出下一段文字。
Meta表示,模型会根据不同词语的识别难度动态调整等待时间。对于较容易识别的内容,会更快完成输出;遇到更复杂的词语时,则会增加监听时间,以在识别准确率和转写延迟之间取得平衡。相关策略通过强化学习训练完成。
根据Artificial Analysis的独立测试,Muse Voice Transcribe英文单词错误率为3.1%,说话结束后的输出延迟约为0.16秒。相比之下,ElevenLabs Scribe v2 Realtime的错误率为3.6%、延迟约0.14秒,AssemblyAI Universal-3.5 Pro Realtime的错误率为4.0%。

除实时转写外,Muse Voice Transcribe还将说话人识别、说话人切换检测及语句边界判断整合在同一模型中。系统可同时区分20名以上说话人,并支持超过1小时的连续录音处理,无需后期处理。Meta还展示了8人在同一空间内交谈时,模型实时区分不同说话人的演示。
语言能力方面,Meta称该模型训练覆盖70多种语言,其中25种经过较为完整的测试,同时支持一段话中切换不同语言。开发者还可以提供语言、关键词及上下文提示,以提高专有名词等内容的识别准确率。

价格方面,Muse Voice Transcribe定价为每小时0.18美元,即每1000分钟3美元。作为对比,Cartesia Ink-2为4美元,ElevenLabs Scribe v2 Realtime和Deepgram Flux均为6.5美元。
Meta此次发布也明显指向AI眼镜等持续在线的个人AI设备。公司在演示中强调,稳定的实时语音识别是个人AI Agent理解真实对话的重要基础,而说话人识别和长时间连续转写能力,也能够用于AI眼镜在多人交流环境下获取和处理语音信息。
目前,Meta AI和Muse Code中的语音输入功能已经采用Muse Voice Transcribe,开发者也可以通过Meta Model API调用该模型。Meta暂未公布其参数规模、训练数据量及具体音频来源,模型权重也未开放。
▍AR超表面光波导厂商阿法龙完成超亿元B轮融资
近日,据36Kr消息,AR光学企业阿法龙控股(北京)有限公司近日完成超亿元人民币B轮融资。本轮由老股东梅花创投领投,德阳国资、宁波国资跟投,募集资金将主要用于大视场角光波导芯片研发攻坚、四川德阳量产基地产能扩建,以及光通信器件业务的产业化落地。

阿法龙成立于2017年,总部位于北京,为国家高新技术企业、专精特新企业,业务覆盖超表面光波导芯片、AR智能眼镜整机及行业解决方案,已打通从芯片设计、母版制造到量产加工的全流程闭环。
和多数AR创业公司的切入路径不同,阿法龙创始人徐培培是北大博士出身,曾在华为负责荣耀产品线业务。2015年他判断下一代移动计算终端大概率向AR方向演进,由此启动创业。公司早期以AR整机业务为主,面向政企与行业市场,曾拿下国内警务领域AR设备出货量最高的成绩。也正是在整机业务推进过程中,团队发现供应链端没有能匹配需求的光波导显示方案,最终决定下场自研。
2020年,阿法龙正式启动光学研发,选择了一条和国内外同行差异明显的技术路线——基于碳化硅新材料的超表面光波导,核心思路是用半导体工艺制造光学芯片。
徐培培还透露,阿法龙即将发布新一代大视场角光波导产品。该产品通过创新的光学微纳结构设计,兼顾轻薄形态与量产成本,有望解决消费级AR眼镜“大视场、轻量化、低成本”的核心痛点。
营收方面,阿法龙2025年营收约7000万元,预计2026年将翻倍至1.5亿元左右,目标2028年突破5亿元。
▍字节跳动研发空间视频生成AI模型,张一鸣亲自督战
字节跳动正在推进一款实时空间视频生成AI模型的研发,正式入局世界模型赛道,未来将与Meta、Alphabet在机器人技术、自动驾驶等应用领域展开竞争。
据知情人士透露,公司创始人张一鸣正亲自统筹该项目,协调跨部门资源,倾斜AI研发力量与算力投入,模型预计最快下月正式面世。不过也有相关人士表示,具体发布时间尚未最终敲定,项目计划仍存在调整可能。字节跳动发言人暂未回应相关置评请求。

这款新模型基于字节跳动现有的电影级视频生成AI模型Seedance开发,核心能力是生成可交互的虚拟世界,可应用于直播、短剧制作以及游戏开发等场景。张一鸣希望依托字节在视频技术领域的积累,借助这款产品将TikTok创作者生态接入快速发展的世界模型领域。
该项目是字节跳动内部战略调整的重要一环。这家总部位于北京的公司正逐步将大量ToB业务资源转向视频制作与生成赛道。在内部定位中,这款可打造沉浸式三维世界的空间视频模型,定位类似谷歌此前推出的Genie,将作为业务飞轮,打通字节的AI技术、云计算资源,联动内容平台生态以及旗下XR品牌Pico的硬件布局。
字节跳动与谷歌的相关产品同属以视频为核心的世界模型技术路线,目标都是构建能够为AI智能体模拟真实物理环境的模型。谷歌今年早些时候推出的Genie,已支持用户与实时渲染的虚拟世界进行交互。这类空间模型也被普遍视作机器人、自动驾驶等领域的关键底层技术,张一鸣也将借此入局,和李飞飞、杨立昆等业内研究者一同探索视觉AI的技术路径。
如果该模型落地顺利,字节跳动将在XR硬件之外,和Meta、苹果开辟新的竞争战线。目前Meta正围绕Quest系列头显搭建大众级XR生态,苹果则以Vision Pro布局高端空间计算市场,两者在向主流渗透的过程中均面临挑战,而空间AI模型有望成为行业下一个核心竞争点。
▍三星将下架两款手机AR应用,“Quick Measure”和“AR Doodle”应用终止服务
三星近日确认,旗下Galaxy手机搭载的两款经典增强现实应用——“快速测量(Quick Measure)”与“AR涂鸦(AR Doodle)”,将于2026年12月31日正式终止服务。
其中“快速测量”可借助手机摄像头,直接测量现实场景中的物体距离;“AR涂鸦”则支持用户通过相机,在实景画面的对应位置绘制创意图形。两款应用均已在Galaxy手机上线多年。

三星表示:
请注意,快速测量应用程序的服务计划于 2026 年 12 月 31 日终止。
此日期之后,我们将停止提供该应用的下载和更新支持。如果您已下载该应用,则可以继续使用,但请注意,部分功能可能无法正常运行。
此外,未来的操作系统更新将不再提供对快速测量应用程序的兼容性支持。
由此给您带来的不便,我们深表歉意,并感谢所有客户一直以来对快速测量应用程序的支持。我们将致力于在未来提供更优质的服务。
三星同时表示,这两项AR服务未来会以优化升级后的形态重新推出,但暂未公布新版本的具体上线时间。
▍Meta遭集体诉讼,被指利用社交平台照片训练AI眼镜人脸识别系统
当地时间9月7日,据外媒biometric update报道,Meta在美国面临一项拟议中的全国性集体诉讼。原告指控,Meta未经用户同意,利用Facebook和Instagram上的照片提取生物识别信息,用于开发一套尚未正式发布、面向智能眼镜的人脸识别系统,同时还将相关图像用于生成式AI模型训练。

这份长达66页的诉状已提交至美国伊利诺伊州北区联邦地区法院。案件名为“Alvarez et al. v. Meta Platforms, Inc.”,原告包括伊利诺伊州居民Francisco Alvarez及其未成年子女,以及加利福尼亚州居民Jeremy Wahl及其未成年女儿。诉讼涉及《伊利诺伊州生物识别信息隐私法》(BIPA)、加州肖像及挪用相关法律,以及加州宪法中的隐私保护条款。
此次诉讼的核心之一,是Meta内部代号为“NameTag”的人脸识别技术。据此前报道,该技术面向Ray-Ban Meta、Oakley Meta智能眼镜及Meta AI配套应用开发。相关系统尚未向消费者正式推出,其代码今年6月被发现隐藏在Meta AI应用中。
按照此前曝光的设计,NameTag可通过智能眼镜摄像头获取人脸,将其转化为“faceprint(人脸模板)”,再与用户设备中的人脸数据进行比对,从而识别眼前人物。
此次诉讼关注的不只是Meta是否已向消费者开放该功能。原告进一步指控,Meta曾从Facebook和Instagram照片中提取人脸特征,用于训练和测试NameTag,并将相关图像用于Emu、Muse Image等生成式AI模型训练。诉状称,Emu最初使用约11亿组图文数据进行训练。
Meta此前回应称,公司确实在探索人脸识别技术,但“尚未向消费者推出任何相关功能”,也未建立集中式人脸数据库。目前,Meta尚未针对本次诉讼提交实质性答辩。
原告还援引Meta今年5月公开的一项专利申请作为佐证。该专利描述了智能眼镜拍摄人脸、生成生物特征向量,并与平台已有照片或视频进行比对的技术方案。不过,专利本身并不能证明相关系统已经实际部署。
此次拟议中的全国性集体诉讼覆盖照片曾被上传至Facebook、Instagram,或被提交给Meta生成式AI模型的美国用户,时间范围自2021年9月4日起。目前集体诉讼资格尚未获得法院认证。
原告要求Meta停止相关数据处理行为并赔偿损失。根据BIPA,故意或鲁莽违规最高可按每次5000美元索赔,过失违规则为每次1000美元。
Meta此前也曾因生物识别数据问题面临诉讼,包括支付6.5亿美元和解伊利诺伊州BIPA集体诉讼,以及于2024年支付14亿美元解决得州相关指控。此次案件目前仍处于早期阶段,相关指控尚未经法院裁定。

推荐阅读



