在 250 个图像转视频提示词上,我们评估了 Model Router 相较于 SOTA 模型基线,如何降低成本并保持生产可用性。请通过下方链接阅读更多内容。
全部AI 动态
全部动态
今日 13 条
Runway@runwaymlAI 评分2525Claude:Blog(网页)AI 评分5757 Claude Tag 支持在 Slack 频道中使用个人连接器
Anthropic 宣布 Claude Tag(beta)支持在 Slack 频道中使用用户自己的连接器,此前 Claude 只能用管理员附加到频道的连接器。
Anthropic:Research(发表成果 · 网页)精选AI 评分6161 Anthropic Project Swap 实验:201 名员工让 Claude 智能体替人换书交易
Anthropic 开展 Project Swap 实验,让 201 名员工携带一本书,其 Claude 智能体在数字交易大厅代表他们谈判换书。5 分钟聊天后,Claude 构建的图书排序与本人自评排序在 61% 的书对上一致;市场效率为 0.55(最优 0.89),其中 85% 的差距来自智能体对参与者偏好的理解不足,而非谈判表现。
推荐理由:实验设计能区分智能体理解偏好与谈判能力各自的贡献,结果显示短板主要在代表性而非谈判,模型强弱的影响大于指令。
Google Research:Blog(网页)AI 评分5656 Google Research 发布 AI 视频联合导演研究,用多智能体框架生成连贯长视频
Google Research 提出基于 Gemini 和 Veo 的多智能体编排框架,将长视频生成建模为全局优化与世界状态跟踪问题,包含 Co-Director(COLM 2026)、CANVAS(EMNLP 2026)、A²RD 和 VQQA 四个框架,支持 SynthID 水印。
Arena.ai@arenaAI 评分6161
Arena.ai@arenaAI 评分4848GitHub BlogAI 评分5959 GitHub Copilot app 的 canvas:聊天何时是错误的 UI
GitHub Copilot 员工撰文认为聊天框往往不是与 AI 协作的正确界面,并介绍 GitHub Copilot app 中的 canvas 功能:canvas 是运行在 app 内、无浏览器外壳的全栈小应用,可与 agent 双向通信。
Midjourney:Updates(RSS)AI 评分4343 Midjourney 更新编辑模型与缩略图预览,V8.1/8.2 平铺无缝化
Midjourney 在 alpha.midjourney.com 界面测试快速模型,Styles 侧边栏新增 "Live previews",可预览提示词在已点赞和精选风格下的效果,点击缩略图即可用该风格生成。编辑模型的 inpainting 和 outpainting 得到改进,定向编辑只改变选中像素,可反复编辑而不降低画质;tile --tile 在 V8.1/8.2 上实现瓦片间无缝融合。
Factory 研究 / 产品(RSS)AI 评分4141 Factory 的 Legacy-Bench 加入 Fireworks 专项智能指数,评测哪款模型最适合遗留代码
Factory 的 Legacy-Bench 已加入 Fireworks 的 Specialized Intelligence Index(SII),用于评测前沿模型在 COBOL、Java 7、BASIC、C89、Fortran 和 Assembly 上的调试、实现与迁移能力。
Databricks:Blog(RSS)AI 评分4646 在 Databricks SQL 中运行开源决策模型 SemIf-OpenJev
Databricks 发布可导入 Notebook,支持在 SQL 中通过 ai_query 直接调用开源决策模型 SemIf-OpenJev,并返回结构化分类结果与选项概率。该流程借助 Serverless GPU 与 AI Runtime 自动下载模型、注册并创建 GPU Model Serving 端点,三步即可完成部署,示例用于将酒店评论分类为好评或差评。
Midjourney@midjourneyAI 评分3737
Midjourney@midjourneyAI 评分5454GitHub Blog精选AI 评分6464 GitHub Security Lab 发布 LLM 驱动的 Fuzzing Taskflow,自动完成 C/C++ 项目模糊测试全流程
GitHub Security Lab 的 Antonio Morales 开源了基于 Taskflow Agent 的 Fuzzing Taskflow,指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖报告并分诊崩溃。
推荐理由:作者开源了完整的自主模糊测试流水线,并讲清覆盖反馈、结构感知和崩溃分诊的设计取舍,C/C++ 维护者可直接复用。
Replit ⠕@ReplitAI 评分4141Claude Code:GitHub Releases(RSS)AI 评分3939 Claude Code v2.1.282 发布
Claude Code 发布 v2.1.282,新增 maxProseWidth 设置,可在宽终端中限制 Claude 正文宽度,表格与代码块仍保持全宽。该版本还修复了会话续接时重复发送历史消息、扩展思考被丢弃,以及 web 搜索结果无法解密导致请求 400 报错等问题。
Apple Machine Learning Research(RSS)AI 评分3939 Apple 提出半监督联邦 ASR 实用方案:在线伪标签与服务器更新稳定化
针对半监督联邦学习 ASR 中伪标签误差跨序列、跨轮次累积导致发散的问题,Apple 研究指出缩小与全监督联邦学习差距取决于教师与锚点两条耦合设计轴。每客户端在线教师经稳定化后在同域匹配或超越广播全局教师,服务器在轮次间持续用标注数据训练是防止在线教师漂移的关键。该方案在 11 组对比中 9 组优于最强先前方法,同域平均提升 20.8%,跨域提升 10.0%。
Runway:News(网页)AI 评分4949 Runway 评测 Model Router:成本与质量如何权衡
Runway 用 250 条图生视频提示词对比 SOTA 基线 Seedance 2.5 与三种 Model Router 配置,质量优化路由可用率 77%、单条成本 $1.28,较基线降 29%;加 $1.00 上限后成本降至 $0.61、降 66%,可用率仍有 74%。
Black Forest Labs:Blog(网页)AI 评分5454 Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action
Black Forest Labs 发布 FLUX 3 Action,一个 7B 参数、开放权重的世界动作模型。官方称可将 FLUX 的视觉智能转化为动作能力,用于机器人、模拟器或游戏。
Baseten 工程博客(网页)AI 评分5454 LangSmith Fine-Tuning 发布:smithtune 开源 CLI 可在 Baseten Loops 上微调 Agent traces
LangChain 在 Interrupt 26 大会上发布 LangSmith Fine-Tuning,配套开源 CLI smithtune(github.com/langchain-ai/smithtune)。
Replit ⠕@ReplitAI 评分2828
OpenRouter@OpenRouterAI 评分2929
Odyssey@odysseymlAI 评分4141推出 Agora-2,我们新一代多智能体世界模型。 Agora-2 支持最多 20 个人类与智能体在同一共享环境中交互,全部实时模拟。 我们的多人研究预览版现已开放体验!
Perplexity@perplexity_aiAI 评分4646
Krea@krea_aiAI 评分4646在 Krea Agent 中推出自定义应用。 构建按你想要的方式工作的创意工具。角色工作室、3D 查看器、动态效果。只需描述这个应用。 了解更多 + 示例见下方 👇
OpenAI Developers@OpenAIDevsAI 评分2828vLLM 官方博客(RSS)精选AI 评分6666 vLLM 新增基于 Gumbel-max 的无失真文本水印功能
vLLM 宣布支持基于 Gumbel-max 算法的无失真水印,将其集成进 Model Runner v2 的采样管线,并通过 PR #54053、#56122、#56233 实现融合 GPU kernel、双键方案和上下文去重,以兼容投机解码并保持输出多样性。
推荐理由:原文给出水印算法原理、双键与去重方案及实测吞吐数据,读者可评估在生产环境启用水印的可行性与代价。
ClaudeDevs@ClaudeDevsAI 评分5454
Runway@runwaymlAI 评分3636Runway 新功能,Seedance 2.5 的草稿模式。生成更快、消耗更少 credits,方便你探索,然后把满意的作品提升至完整质量。点击下方链接开始使用。
Google Developers Blog(RSS)精选AI 评分6161 Google Cloud API Gateway 推出 MCP 支持,可将现有 REST API 直接暴露为智能体工具
Google Cloud API Gateway 在 Public Preview 中可充当远程 MCP 服务器,无需单独搭建 MCP 服务器,即可把已有 REST API 暴露为智能体可调用的工具。
推荐理由:原文说明了通过注解 OpenAPI 规格让网关直接充当远程 MCP 服务器的做法,并给出配置示例、安全注意事项和当前限制。
Tomer Tunguz 博客(VC 分析)AI 评分5656 Tomer Tunguz:AI 编程时代的软件工程是用循环交付的系统设计
Tomer Tunguz 撰文认为手写代码对多数程序员已不再是经济上有产出的工作,软件工程正转向设计让 AI 大规模正确写代码的系统。
Perplexity@perplexity_aiAI 评分3737Databricks:Blog(RSS)AI 评分3939 Databricks 推出 Unity Gateway CLI,集中管理编码智能体
Databricks 发布 Unity Gateway CLI,管理员可在 Unity Gateway 中集中配置编码智能体的默认模型、MCP 服务器、技能、Smart Routing 和支出策略,开发者用 ug claude、ug codex 等命令即可启动已批准的智能体。
Claude:Blog(网页)AI 评分7676 Anthropic 解释 Claude Opus 5.5 为何更适合长上下文编码会话
Anthropic 发文解释 Claude Opus 5.5 为长上下文编码会话降本的三方面变化:输入输出 token 降价 20%、缓存读取降价 60%,模型可用更少轮次完成同一任务,Claude Code 也改进了缓存利用。
OpenRouter@OpenRouterAI 评分4747推出 Server Tools Marketplace 一站式获取更好地为你的智能体提供依据的方式,包括 web search API、Shell、工具搜索等 👇
Google DeepMind:Blog(RSS)AI 评分5050 Google 发布 Gemini 3.8 Live with Live Avatar,为对话 AI 带来实时视觉形象
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让 AI 具备能听、能看、能说的动态视觉形象,即日起在 Gemini Enterprise 可用。
WorkBuddy@WorkBuddy_AIAI 评分2323在北美找工作?💼 让 WorkBuddy 在每一步帮你——从打磨简历、准备面试到比较工作机会。 你的下一个机会,可能就始于一个正确的问题。
WorkBuddy@WorkBuddy_AIAI 评分1717
Replit ⠕@ReplitAI 评分2727Apple Machine Learning Research(RSS)AI 评分4242 Apple 用潜空间蒸馏压缩流式神经音频编码器
Apple 提出以预量化器潜变量为监督目标的蒸馏方法,压缩 System-wide Dictation 的流式神经音频编码器,学生编码器仅需回归教师逐帧潜变量,并用单层仿射层吸收宽度差异。在 2.8× 压缩率下,六组教师-学生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。
Artificial Analysis 完整文章(网页)AI 评分4040 Artificial Analysis 发布 Cyber Index 网络安全评估联盟
Artificial Analysis 推出 Cyber Index,整合 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项评估,覆盖从代码审计、漏洞发现到复现与修补的防御全流程。该指数基于 Stirrup 开源代理框架运行,重点测试模型在拥有源代码访问权限下的漏洞识别与修复能力,并单独记录因安全原因拒绝任务的情况。目前暂不包含利用漏洞生成攻击载荷的能力评估。