NVIDIA 发布开源说话人分离模型 Nemotron 3 Diarization,支持实时追踪 8 个说话人
NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,参数量 100M,可实时追踪最多 8 个说话人并处理语音重叠,采用 OpenMDW License 1.1 许可证允许商用。
NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,参数量 100M,可实时追踪最多 8 个说话人并处理语音重叠,采用 OpenMDW License 1.1 许可证允许商用。
NVIDIA 发布开源权重、100M 参数的 Nemotron 3 Diarization 说话人分离模型,支持最多八名说话人,在 VoiceArena Diarization-Bench 12 个系统中以 14.72% DER 排名第一,比第二名低约 24% 相对值。
GitHub 与 Yale Program on Climate Change Communication 对 1039 名 GitHub 美国用户调查显示,80% 有兴趣使用帮助编写更节能代码的工具,74% 想测量软件或开发流程的环境影响,71% 担心 AI 的环境影响。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型,分别用于从文字生成 UI、信息图、海报等设计和将设计图拆为可编辑透明图层,同时开源 Design Skill 和 PPT Skill。
Kyutai 发布 Voice of Reason,两个基于 GLM-4-Voice-9B 的开源权重语音到语音模型,无需转写和独立文本 LLM 即可口头解数学题。
推荐理由:原文给出 Arena 两个榜单的开源第一排名和具体分数,读者可以据此比较开源图像模型的当前水平。
阿里巴巴 CEO 吴泳铭在杭州云栖大会 2026 上分享机器智能时代战略路线图,称机器思考目前不足人类思考总量的 3%,规模化到人类能力的 1,000 倍仍有巨大空间。
LlamaIndex 发布 LiteParse 2.14.6 更新,通过对自维护 PDFium fork 做内存分配优化(内置 mimalloc)等手段,将文本提取耗时降低 20-25%,平均 2.76ms/页,markdown 渲染 3.94ms/页。
推荐理由:原文给出速度、表格准确率等实测对比数据和新增 API,读者可据此评估是否替换现有 PDF 解析方案。
小米发布 MiMo-V2.6 系列,旗舰 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 得 46 分,居开源模型之首,价格为每百万输入 token $0.435、输出 $0.87。
小米发布 MiMo-V2.6 系列,包含原生全模态模型 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash,并推出输出速度最高提升 20 倍的 MiMo-V2.6-Pro-UltraSpeed。
推荐理由:小米以约 300 万美元训练成本推出原生全模态开源模型,并公开 RL 环境与训练配方,可对照中国开源模型的成本路线。
小米发布并开源 Xiaomi MiMo-V2.6 系列,含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。
作者开源awesome-seedance项目,将463条实测复现并打分分类的AI视频提示语整理成14个提示语模版和25个Skills,涵盖分镜脚本、角色一致性、手持UGC vlog、打斗等类型,仓库地址为 github.com/LearnPrompt/awesome-seedance。
作者实测同日凌晨发布的 Grok 4.7 与小米 MiMo V2.6,认为 Grok 4.7 低于预期,MiMo V2.6 成为性能、价格、速度三角的当前版本答案。
推荐理由:作者亲手测试并给出价格、速度和基准对比,读者可以据此评估小米 MiMo V2.6 对自身工作流和成本的实际影响。
小米发布并开源 MiMo-V2.6 系列,含 Pro 与 Flash 两个原生全模态模型。MiMo-V2.6-Pro 在 AA 智能指数 v4.3.2 取得 46 分。
AWS Strands Agents 团队发布开源通用 agent harness Strands harness,基于 Apache 2.0 提供 Python 和 TypeScript 版本,一行 create_harness() 即可运行,支持 Bedrock、Anthropic、OpenAI、Google、Ollama 和 LiteLLM。
小米 MiMo-V2.6 系列三款模型上线 OpenRouter,包括 1T+ 参数旗舰、开源 MoE 模型和约 10 倍速的旗舰变体。三款模型均支持文本、图像、视频和音频输入,上下文为 1M。
推荐理由:官方发布全模态模型并开放权重、技术报告和训练代码,附与 Claude Opus 5、GPT-5.6 Sol 的 Agent 基准对比数据。
Xiaomi MiMo 于今日正式发布并开源 MiMo-V2.6 系列模型,包含 Pro 与 Flash 两个原生全模态模型,称这是探索 RSI(递归自我改进)路径的关键一步。
Meta 宣布开源 Rebalancer,一个用于解决资源分配问题的通用求解库,已在 Meta 内部使用超过九年,目前每天解决约 4000 万个分配问题,涵盖 30 多种问题建模。
阿里 Qwen 团队发布 Qwen-Image-2.1,将文生图与图像编辑统一到一个 7B 单流 DiT 模型中,搭配 8B Qwen3-VL 编码器,支持原生 RGBA 透明输出和最多 10 张参考图编辑。
Hacker News 社区转发 Heretic 项目页面,称其可以移除语言模型的限制,正文仅含标题与 104 HN Points,未提供更多细节。