前 DeepMind 研究员创立的 Emulate 拟融资 7 亿美元,估值或达 37 亿美元
据《金融时报》报道,前谷歌 DeepMind 研究员创立的英国初创公司 Emulate 正与潜在投资者深入谈判,计划种子轮融资最多 7 亿美元,完成后估值可达 37 亿美元,英国 Index Ventures 和硅谷 Lightspeed Venture Partners 预计共同领投。
据《金融时报》报道,前谷歌 DeepMind 研究员创立的英国初创公司 Emulate 正与潜在投资者深入谈判,计划种子轮融资最多 7 亿美元,完成后估值可达 37 亿美元,英国 Index Ventures 和硅谷 Lightspeed Venture Partners 预计共同领投。
抖音宣布上线声音侵权举报入口并升级维权机制,近一个月侵权投诉中提及声音侵权的举报量同比翻倍。升级后提供专属维权入口与可核验举证方式,支持语音录入核验或上传原声视频两种方式,并设有申诉通道,官方举报地址为 https://www.douyin.com/qinquan/report。
高德地图 2026 发布,核心升级导航 Live 将自然对话、多模态感知和空间理解融入驾车、步行和游览场景,可识别施工等路况、按需求调整路线并生成与行程时长匹配的个性化播客。高德 AI 对话聚焦出发前复杂出行规划,可调用避雷指南从营业时间、行程节奏等 15 个维度提前识别风险;鹰眼守护预警系统新增 4 类骑行场景,覆盖风险由 24 类扩展至 28 类,累计播发预警超 629 亿次。
Google 在 Gemini API 和 Google AI Studio 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型,支持异步函数调用、视觉上下文、97+ 语言和可配置思考,Extended Thinking 版位列 Artificial Analysis 语音到语音榜单第一。
NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 preview 结果,Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,DeepSeek-R1 上最高 2.5 倍。
科大讯飞上线语音基座大模型 Spark-Audio-1.0-Preview,采用 0.65B Dense 音频编码器搭配 30B-A3B MoE 大语言模型,使用 1300 万小时音频数据基于纯国产算力集群训练。
2026年9月16日,Mistral AI 宣布与 Mozilla 达成合作,其模型将驱动 Firefox 的 AI 浏览助手“Smart Window”(测试版)。该功能帮助用户处理复杂搜索、记忆浏览内容并基于标签页获取信息。初期覆盖法国和北美用户,英德随后跟进。双方强调开源、隐私保护(默认不保存对话、零数据保留)及针对区域语言和文化语境优化的能力,旨在打破单一公司垄断,赋予用户对 AI 交互的控制权。
蚂蚁集团 inclusionAI 在 Hugging Face 发布 Realtime-Venus,包含 Realtime-Venus-Omni 和 Realtime-Venus-Audio 两个 9B 检查点,基于 MiniCPM-o 4.5 / Omni-Flow 架构,语言骨干为 Qwen3-8B。
蚂蚁集团 Venus 团队与清华大学在 GitHub 开源 Realtime-Venus,一个支持全双工对话与异步任务委托的实时交互系统。系统包含三个组件:Realtime-Venus-Omni(9B,流式音视频对话与主动交互)、Realtime-Venus-Audio(9B,语音交互与音频理解)以及负责后台任务执行并将结果返回同一对话的 Harness 运行时。
推荐理由:蚂蚁和清华开源了全双工对话加异步委托任务的系统,含 9B 的 Omni 与 Audio 两个模型和 Harness 运行时,可直接下载推理或跑浏览器 demo。
努比亚发布 NaviX Ultra 手机,宣称是首款 AI 智能体手机,售价 5999 元起,国补后 5499 元起。该机由豆包手机助手主导 AI 体验,搭载 Seed 全双工语音大模型和第五代骁龙 8 至尊版,支持一句话跨应用执行任务,端到端任务成功率超 80%,AI 唤醒率优于竞品 48%,并完成智能体大模型备案。
Apple 推出 Apple Reference Image,一种 iPhone 上的可验证摄影方案,首发于 iPhone 18 Pro 和 iPhone 18 Pro Max 主摄像头。
火山引擎宣布豆包大模型 2.1 Pro 更新至 0915 版本,API 全量上线火山方舟,豆包 App 与 TRAE 已同步接入。
火山引擎宣布 Doubao-Seed-2.1-pro 更新至0915版本,API 已全量上线火山方舟,豆包 app 和 TRAE 同步接入。
vivo 在 2026 开发者大会上发布四款蓝心大模型,包括端到端 MoE 架构的 BlueLM-RealTime、30 亿参数的 BlueLM-Nano 和搭载自研 Agentic 引擎的 BlueLM-Flash / Pro。同时推出系统级蓝心 Harness,深入原系统内核层,已增加 6000 多项原子技能,支持超万种任务,并预研蓝心 30B MoE 端侧大模型。
据 MacRumors 报道,苹果为首款折叠手机 iPhone Duo 的双屏设计定制了新拍摄体验,包括利用 A20 Pro 芯片设备端 AI 在摆好姿势时自动拍合照的智能拍摄(Smart Take)、用外屏播放《花生漫画》吸引孩子看镜头的看看镜头(Kid Cue)、外屏实时取景的 Duo 预览,以及好友可经外屏加入通话的 Duo FaceTime。
苹果 9 月 15 日发布博文,介绍在 iPhone 18 Pro、iPhone 18 Pro Max 等机型引入的 Apple Reference Image 功能,可在拍摄时对照片进行硬件级证明与时间戳绑定。
OpenRouter 梳理其目录中的 DeepSeek V4 系列图像输入支持情况:V4.1 Flash 原生读图(2026年9月10日上线,$0.15/$0.60 每百万 token)。
推荐理由:原文逐一列出 DeepSeek V4 各型号是否支持图像输入、价格和调用方式,并给出文本-only 型号配视觉模型的两段式替代方案。
谷歌于 9 月 15 日推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化部署与成本优化,后者面向高复杂度任务、强化多步推理。
Google AI 发布迄今最先进的 Gemini 音频模型 Gemini 3.8 Live 与 3.8 Live Extended Thinking。
作者 Zho 实测 GPT-6 Astra,仅凭一句提示词、不提供照片,让其完成精细建模、渲染、分镜、旁白、原创配乐到剪辑的 2 分钟建筑短片《POMPIDOU:A PUBLIC MACHINE》。
Meta 于 9 月 15 日上线 Meta One 订阅套餐,将 Facebook、Instagram、WhatsApp 订阅与更多 Meta AI 使用额度打包,面向 AI 重度用户、创作者和商业用户。
Google 宣布其语言技术已支持超过 300 种语言、覆盖全球 86% 人口,并发布 TranslateGemma 轻量开源翻译模型(基于 Gemini 训练、支持 55 种语言、可离线运行)。
推荐理由:原文来自 Google 对其语言技术的系统性梳理,读者可以借此了解其多语言 AI 的技术路线和数据合作方式。
生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。
推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。
作者开源 fugleramme,一个基于 Raspberry Pi 5 和 Inky Impression 13.3 英寸电子墨水屏的画框,通过 BirdNET-Go 在本地实时识别麦克风听到的鸟鸣,并匹配 19 世纪公共领域博物学插画渲染展示,已收录超过 800 张手工抠图、覆盖 400 多个物种。
ModaLens 论文提出一种成对图像替换审计方法,测量放射报告存在与否如何影响医疗 VLM 对影像的依赖。
Apple 在多年延迟后以 beta 形式发布基于 Google Gemini 模型重构的 Siri AI,目前仅支持英语,属于 iOS 27 等 2027 软件版本的一部分,模型部分在设备端运行、部分经 Private Cloud Compute 处理。
NIH 宣布加州大学旧金山分校研发出可同时解码瘫痪患者预期语言和上肢动作的新型脑机接口,成果发表于《自然·神经科学》。团队在 Edward Chang 带领下为 3 名因 ALS 或脑干中风瘫痪的患者植入薄型电极阵列,其中 2 名参与者的脑活动可驱动同步说话和做动作的全身虚拟化身。
阶跃星辰发布 StepAudio 3 系列语音模型,包括 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen 和 StepAudio3Music,均已上线阶跃星辰开放平台。
阶跃星辰发布 StepAudio 3 系列,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,已在阶跃星辰开放平台上线。
推荐理由:官方完整介绍了五款模型的能力与榜单成绩,可帮助读者了解语音模型在实时交互、理解和创作上的进展。
MacStories 主编 Federico Viticci 发布博文,汇总 iOS / iPadOS 27 的 54 条隐藏新功能与新特性。
Zing-0.5 是一个 5B 自回归世界模型,支持键盘与文本联合控制,让用户在生成世界中导航并影响事件。技术要点包括统一动作与文本条件、事件级分布匹配蒸馏,以及四步生成加流式推理,在 832x480 分辨率下以 24 FPS 运行,估计服务器成本约每流分钟 0.009 美元;在 158 个 WBench Navigation 用例上取得总分 81.0 和一致性 88.5。