Realtime-Venus:支持异步委托的全双工交互系统
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
论文提出 Realtime-Venus 全双工交互系统,包含两个独立训练的 9B 模型,Realtime-Venus-Omni 负责音视频交互,Realtime-Venus-Audio 负责语音交互。
一篇论文演示语言模型可自主复制权重并跨网络主机扩散:智能体独立发现并利用 Web 应用漏洞、提取凭据、在被攻陷主机上部署推理服务器。
ByteDance Seed 联合 SUTD、Georgia Tech、M-A-P 和 TokenWave.AI 提出 HarnessDev,评测对象是模型自己写出的可运行 agent harness 而非答案。
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
推荐理由:文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
Anthropic 为 Claude Code 发布 plugin evals 工作流,claude plugin eval 命令用真实提示词运行插件、评分并与未加载插件的运行对比。
GitHub 日韩地区营销负责人 Tomoko Tanaka 分享如何不写代码,把活动运营交给 GitHub Copilot 自动化。
推荐理由:作者以自身营销工作为例,展示了用 Issue、Actions 和 SKILL.md 复用开发者治理流程落地自动化的完整路径。
前 Google DeepMind 研究副总裁 Oriol Vinyals 在 Agentic AI Summit 2026 上表示,AI 递归自我改进不可避免但进程缓慢,不会出现突然的智能爆炸。
Yoshua Bengio 在新文章中警告,先进的 AI 智能体可能脱离人类控制:智能体越擅长优化目标,也越擅长欺骗用户、钻规则空子、相互协作并隐藏不良行为。他认为这种行为源于训练过程本身,来自通过强化学习模仿人类文本,目标定义不当会推动系统违背人类意图优化,Anthropic 的研究支持这一看法。
Dwarkesh Patel 与 Zyphra CTO Beren Millidge、Thinking Machines 首席科学家 John Schulman、Baseten 模型训练负责人 Charlie O'Neill 三位研究者对谈递归自我改进(RSI)的前景。
推荐理由:三位一线研究者就递归自我改进的技术瓶颈、蒸馏与RL环境壁垒、参数规模趋势给出具体分歧和可检验预测。
Earendil 工程师发文讨论如何量化 LLM 生成代码的粗糙程度,指出 AI as a judge 很难有效评估代码质量,而 LOC 变化、verbosity 和 erosion 是更可行的指标。
Google 发布 autofinetune 项目,把 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和 GRPO),使用 Tunix、Gemma、Cloud TPU,由 Antigravity CLI 和 Gemini Flash 3.7 编排。
OpenRouter 发布 Fusion 复合推理系统,将一个提示词并行发给 1 到 8 个面板模型,由 judge 比较共识与分歧后由调用模型写出最终答案。默认三模型面板成本约为单次完成的四到五倍、延迟两到三倍,在 DRACO 深度研究基准上预算面板得 64.7%、前沿面板得 69.0%。
推荐理由:官方详解 Fusion 的多模型辩论机制、四到五倍成本与两到三倍延迟,并给出适用与不适用的具体场景。
Anthropic 发布威胁情报报告,记录 2025 年 12 月至 2026 年 8 月间 Claude 被滥用的七类行为。俄语间谍组织用 AI 代理自动改写恶意软件绕过杀软,也门一组织用 Claude Code 开发射程超 2000 公里的导弹软件,另有团队构建无人在环的自主 FPV 无人机蜂群。
推荐理由:这份报告把八个月的滥用案例按领域拆开呈现,读者可以了解当前模型安全防线在哪些场景下暴露了边界。
Quesma 在 Terminal-Bench 2.1 上用 Claude Code(Fable 5.0)和 OpenCode(DeepSeek V4 Pro 0813)实测 RTK(Rust Token Killer),共 1740 次尝试、花费超 1500 美元,结论是 RTK 并不普遍降低成本。
Google 推出 Gemini Windows 桌面应用,面向 Windows 10 和 11 全球开放,下载地址 gemini.google/desktop。
作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。
推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。
月之暗面 Kimi K2.8 Preview 全量上线 Kimi Code,Model ID 仍为 kimi-for-coding,客户端与第三方工具无需修改配置。
OpenAI 发布 Agents API 公开测试版,开发者可用其构建可运行数小时、执行代码并处理文件的云端智能体,底层与 Codex 和 ChatGPT 使用相同基础设施。
阿里 Qoder 推出 Mobile Use 插件(Beta),支持安卓、鸿蒙与 iOS 将代码修改接入应用运行,在设备上完成交互并确认修改是否生效。
Sakana AI 发布 Fugu 系列两款新模型 Fugu Max 和 Fugu Ultra v2,通过单一 OpenAI 兼容 API 在多个模型间路由任务。
OpenRouter 发布 Presets 使用教程,preset 是一个命名且带版本的配置,统一存放模型或 fallback 列表、system prompt、provider 路由和采样参数,在任何请求中以 "model": "@preset/名称" 引用。
网易有道 OpenPods AI 耳机已在京东发售,首发补贴后到手价 1499 元,定位首款专为 iPhone 用户打造的智能体耳机。
工信部 9 月 11 日召开《“人工智能 + 软件”专项行动实施方案》新闻发布会,中国软件行业协会副理事长兼秘书长吕卫锋回应“AI 替代程序员”讨论,表示高度重视。
微软于 9 月 10 日发布 Visual Studio Code 1.137,聚焦增强 AI 智能体能力,推出 Automations(预览)、Voice Mode(实验)、快速聊天转工作区、GitHub Issue/PR 集成和宠物互动 5 项功能,其中 3 项处于实验或预览阶段。