跳到正文

全部动态

今日 13 条
9月25日周五
  1. Anthropic:Research(发表成果 · 网页)61

    Anthropic Project Swap 实验:201 名员工让 Claude 智能体替人换书交易

    Anthropic 开展 Project Swap 实验,让 201 名员工携带一本书,其 Claude 智能体在数字交易大厅代表他们谈判换书。5 分钟聊天后,Claude 构建的图书排序与本人自评排序在 61% 的书对上一致;市场效率为 0.55(最优 0.89),其中 85% 的差距来自智能体对参与者偏好的理解不足,而非谈判表现。

    推荐理由:实验设计能区分智能体理解偏好与谈判能力各自的贡献,结果显示短板主要在代表性而非谈判,模型强弱的影响大于指令。

  2. Midjourney:Updates(RSS)43

    Midjourney 更新编辑模型与缩略图预览,V8.1/8.2 平铺无缝化

    Midjourney 在 alpha.midjourney.com 界面测试快速模型,Styles 侧边栏新增 "Live previews",可预览提示词在已点赞和精选风格下的效果,点击缩略图即可用该风格生成。编辑模型的 inpainting 和 outpainting 得到改进,定向编辑只改变选中像素,可反复编辑而不降低画质;tile --tile 在 V8.1/8.2 上实现瓦片间无缝融合。

  3. Databricks:Blog(RSS)46

    在 Databricks SQL 中运行开源决策模型 SemIf-OpenJev

    Databricks 发布可导入 Notebook,支持在 SQL 中通过 ai_query 直接调用开源决策模型 SemIf-OpenJev,并返回结构化分类结果与选项概率。该流程借助 Serverless GPU 与 AI Runtime 自动下载模型、注册并创建 GPU Model Serving 端点,三步即可完成部署,示例用于将酒店评论分类为好评或差评。

  4. GitHub Blog64

    GitHub Security Lab 发布 LLM 驱动的 Fuzzing Taskflow,自动完成 C/C++ 项目模糊测试全流程

    GitHub Security Lab 的 Antonio Morales 开源了基于 Taskflow Agent 的 Fuzzing Taskflow,指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖报告并分诊崩溃。

    推荐理由:作者开源了完整的自主模糊测试流水线,并讲清覆盖反馈、结构感知和崩溃分诊的设计取舍,C/C++ 维护者可直接复用。

  5. Claude Code:GitHub Releases(RSS)39

    Claude Code v2.1.282 发布

    Claude Code 发布 v2.1.282,新增 maxProseWidth 设置,可在宽终端中限制 Claude 正文宽度,表格与代码块仍保持全宽。该版本还修复了会话续接时重复发送历史消息、扩展思考被丢弃,以及 web 搜索结果无法解密导致请求 400 报错等问题。

  6. Apple Machine Learning Research(RSS)39

    Apple 提出半监督联邦 ASR 实用方案:在线伪标签与服务器更新稳定化

    针对半监督联邦学习 ASR 中伪标签误差跨序列、跨轮次累积导致发散的问题,Apple 研究指出缩小与全监督联邦学习差距取决于教师与锚点两条耦合设计轴。每客户端在线教师经稳定化后在同域匹配或超越广播全局教师,服务器在轮次间持续用标注数据训练是防止在线教师漂移的关键。该方案在 11 组对比中 9 组优于最强先前方法,同域平均提升 20.8%,跨域提升 10.0%。

  7. Runway:News(网页)49

    Runway 评测 Model Router:成本与质量如何权衡

    Runway 用 250 条图生视频提示词对比 SOTA 基线 Seedance 2.5 与三种 Model Router 配置,质量优化路由可用率 77%、单条成本 $1.28,较基线降 29%;加 $1.00 上限后成本降至 $0.61、降 66%,可用率仍有 74%。

  8. vLLM 官方博客(RSS)66

    vLLM 新增基于 Gumbel-max 的无失真文本水印功能

    vLLM 宣布支持基于 Gumbel-max 算法的无失真水印,将其集成进 Model Runner v2 的采样管线,并通过 PR #54053、#56122、#56233 实现融合 GPU kernel、双键方案和上下文去重,以兼容投机解码并保持输出多样性。

    推荐理由:原文给出水印算法原理、双键与去重方案及实测吞吐数据,读者可评估在生产环境启用水印的可行性与代价。

  9. Google Developers Blog(RSS)61

    Google Cloud API Gateway 推出 MCP 支持,可将现有 REST API 直接暴露为智能体工具

    Google Cloud API Gateway 在 Public Preview 中可充当远程 MCP 服务器,无需单独搭建 MCP 服务器,即可把已有 REST API 暴露为智能体可调用的工具。

    推荐理由:原文说明了通过注解 OpenAPI 规格让网关直接充当远程 MCP 服务器的做法,并给出配置示例、安全注意事项和当前限制。

  10. Databricks:Blog(RSS)39

    Databricks 推出 Unity Gateway CLI,集中管理编码智能体

    Databricks 发布 Unity Gateway CLI,管理员可在 Unity Gateway 中集中配置编码智能体的默认模型、MCP 服务器、技能、Smart Routing 和支出策略,开发者用 ug claude、ug codex 等命令即可启动已批准的智能体。

  11. Apple Machine Learning Research(RSS)42

    Apple 用潜空间蒸馏压缩流式神经音频编码器

    Apple 提出以预量化器潜变量为监督目标的蒸馏方法,压缩 System-wide Dictation 的流式神经音频编码器,学生编码器仅需回归教师逐帧潜变量,并用单层仿射层吸收宽度差异。在 2.8× 压缩率下,六组教师-学生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。

  12. Artificial Analysis 完整文章(网页)40

    Artificial Analysis 发布 Cyber Index 网络安全评估联盟

    Artificial Analysis 推出 Cyber Index,整合 CWE-Bench-AA、DeepsecBench-AA 和 CyberGym-E2E-AA 三项评估,覆盖从代码审计、漏洞发现到复现与修补的防御全流程。该指数基于 Stirrup 开源代理框架运行,重点测试模型在拥有源代码访问权限下的漏洞识别与修复能力,并单独记录因安全原因拒绝任务的情况。目前暂不包含利用漏洞生成攻击载荷的能力评估。