小米发布 MiMo-V2.6-Pro 1T-A42B 开源全模态模型,训练成本约 300 万美元
小米发布 MiMo-V2.6 系列,包含原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米以约 300 万美元训练成本推出原生全模态开源模型,并公开 RL 环境与训练配方,可对照中国开源模型的成本路线。
小米发布 MiMo-V2.6 系列,包含原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米以约 300 万美元训练成本推出原生全模态开源模型,并公开 RL 环境与训练配方,可对照中国开源模型的成本路线。
阿里巴巴在 2026 云栖大会公布大模型一系列进展:Qwen4 已在训练中,未来 Qwen4.5、Qwen5 等版本将扩展至 5-10T 参数,下一代视频生成模型将于 11 月发布。
小米发布并开源 Xiaomi MiMo-V2.6 系列,含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。
腾讯混元发布混元图像 3.5 预览版(Hy Image3.5 preview),官方称综合能力较 Hy Image3.0 提升约 30%,内部数百名设计师 GSB 盲测中与 Seedream 5.0 pro 持平,略优于 Nano-Banana Pro 和 Qwen-Image-3.0 Pro。
小米发布并开源 MiMo-V2.6 系列,含 Pro 与 Flash 两个原生全模态模型。MiMo-V2.6-Pro 在 AA 智能指数 v4.3.2 取得 46 分。
小米 MiMo-V2.6 系列三款模型上线 OpenRouter,包括 1T+ 参数旗舰、开源 MoE 模型和约 10 倍速的旗舰变体。三款模型均支持文本、图像、视频和音频输入,上下文为 1M。
推荐理由:官方发布全模态模型并开放权重、技术报告和训练代码,附与 Claude Opus 5、GPT-5.6 Sol 的 Agent 基准对比数据。
Xiaomi MiMo 于今日正式发布并开源 MiMo-V2.6 系列模型,包含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。
Microsoft Research 在 Nature 发表逆合成预测模型 RetroChimera,结合基于 Transformer 的 R-SMILES 2 和图神经网络模型 NeuralLoc,用 learning-to-rank 集成两者互补预测。
Google 宣布 Googlebook AI 笔记本开放预购,售价 $899,运行 Android OS 加桌面版 Chrome,深度集成 Gemini 功能,包括 Magic Cursor AI 光标、Rambler 语音整理和 vibe-coded 小部件。
腾讯混元语音团队联合多所高校发布 Gander 模型,用"小脑"负责实时对话、可替换的"大脑"处理后台智能体任务(测试中用 GPT-5.6 家族模型),可同时处理语音、图像和文本并随时被打断。
通义千问(Qwen)发布实时同声传译模型Qwen3.8-LiveTranslate,采用新的Interleave架构,平均滞后(LAAL)从2.8秒降至2.3秒,约降低18%。
针对现有方法难以捕捉字符间连接、间距和对齐等微观行为的问题,研究者提出 BoundInk。这是一个以写作者为条件的框架,将字符间边界视为显式生成单元,联合建模局部转换与上下文,从而在保持字形外观的同时改善连笔和间距。实验显示,该方法在三项基准测试中显著提升了边界质量指标,并将归一化动态时间规整距离降低了 17.6%--47.8%,在盲测人类评估中的偏好率为 78.0%--82.6%。
Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可联合处理音频和视频并自主使用工具,上下文窗口达 100 万 token。
Neuralink 于 9 月 18 日在 X 平台发布演示,有语言障碍的志愿者 Terry 植入脑机接口后,通过意念将其神经信号转化为与原声高度匹配的合成语音,传达“我爱你”。
阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,基于 Hybrid MoE 的 Thinker–Talker 双模块设计,以 Interleave 架构重构实时同传,字均延迟(LAAL)从 2.8 秒降至 2.3 秒。
Meta CTO 博斯沃思在 Instagram AMA 中表示,不希望少数恶意用户主导公众对 Meta 智能眼镜的看法,称绝大多数人使用方式与手机摄像头无异。
阿里巴巴达摩院开源视觉语言模型 Damo Radar,可分析增强 CT 扫描,覆盖 18 个腹部器官并识别包括癌症在内的近 150 种腹部病变。在近 4 万例真实检查中,模型在 146 项临床发现的平均 AUC 为 0.913;与 26 名放射科医生的对比中,其平均准确率超过其中 23 人,医生借助该模型漏诊预防能力提升 10%,耗时减少逾 30%。研究已发表于《Science》。
Jina AI 发布端到端视觉文档解析模型 jina-ocr-v1,总参数 3.4B,每 token 激活约 570M,可将 PDF、扫描件、表格和发票一次转成 Markdown。
Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。
推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。
阿里 Qwen 团队发布 Qwen3.8-Omni-Flash,称其为首款围绕智能体能力构建的全模态模型,接受文本、图像、音频和视频输入并返回文本,上下文窗口为 1M tokens。
阿里达摩院与浙江大学医学院附属第一医院等机构研发的通用医疗影像 AI 模型 DAMO RADAR 登上《科学》并正式开源,面向腹部增强 CT 诊断,评估覆盖 146 种病症、18 个器官,近 4 万次真实世界检查中 AUC 达 0.913。
阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash,可同时处理文本、图像、音频和视频输入,支持 1M 上下文。在 30 项评测上相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%,官方称音视频能力接近 Gemini 3.8 Flash、音频能力整体超过 Gemini 3.8 Flash。
通义千问发布 Qwen3.8-Omni-Flash,是 Qwen 首个以智能体能力为核心构建的全模态模型,支持原生音视频理解、推理和工具调用。
Snap 首款面向普通消费者的独立式 AR 眼镜 Snap Specs 上市,Wi-Fi 版定价 2195 美元,与 Verizon 合作的蜂窝版定价 2395 美元,数据套餐每月 10 美元起。眼镜采用自研 LCoS 显示技术,51 度视场角,支持电致变色镜片 10 秒内切换墨镜模式,内置两颗高通骁龙处理器独立运行,混合使用续航约 4 小时,配合充电盒约 20 小时。
论文提出 JEPA-Anything,一个基于正交预测分解(OPF)的领域无关世界建模框架,覆盖视觉、生物、临床轨迹、控制、分子动力学、物理场和天气七个领域。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放。
推荐理由:论文给出了每 token KV cache 字节数等具体压缩指标,并与上一代模型直接对比,可评估长上下文 Agent 部署成本变化。
PrismML 发布 Ternary Bonsai 2 27B,基于 Qwen3.8 27B,采用三值权重加 FP16 分组缩放,有效每权重 1.76 bit,模型体积 5.9GB,比全精度模型小 9 倍以上,基准综合得分 83.9,保留全精度模型 98.2% 的性能。
Google Research 发布新研究实验,让教育者用针对学习优化的生成式用户界面(GenUI)动态生成符合其教学目标的互动学习模拟。
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。
推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。
浙江大学等高校的外部研究者以 MiniCPM-o 4.5 为基座后训练,开源了端到端全模态交互智能体 Gander,论文、数据、代码和模型全部开放。