跳到正文

全部动态

今日 1 条
9月18日周五
  1. Apple Machine Learning Research(RSS)43

    REVERSAL-BENCH:用可逆性轴与重置预言机测量无重置强化学习的悬崖

    Apple 研究团队发布 REVERSAL-BENCH,通过连续参数 ρ∈[0,1] 控制环境可逆性,并提供重置预言机在五种物理引擎的八种操作任务中验证状态可恢复性。评测显示,随着 ρ 升高,无重置智能体被持续吸收进不可恢复状态,而分幕式智能体保持稳定学习,形成明显的"可逆性悬崖"。团队同时开源基准套件、带可恢复性标注的多模拟器数据集与重置预言机,并验证了在不可逆失败前介入的安全护盾。

9月17日周四
  1. Sierra:Blog(RSS)30

    Sierra 通过 AIUC-1 认证

    Sierra 宣布已通过 AIUC-1 认证,该认证基于 Schellman 的独立审计以及 Artificial Intelligence Underwriting Company(AIUC)的大量测试。

  2. 公众号:生数科技(Vidu·视频)45

    Vidu S2 实时直播首秀:携手造梦次元让虚拟 IP「紫樱」当 AI 主播

    生数科技 Vidu S2 实时交互与编辑大模型完成直播首秀,携手造梦次元让虚拟 IP「紫樱」以 AI 主播身份开播,支持弹幕应答、投票换装、场景切换、点歌和礼物反馈。模型支持无限时长流式生成与 720P 高清画质,并具备低延迟打断恢复能力;此前基于 Vidu S1 已完成 90 分钟公开直播测试。官方同步发放 3000 份 2000 积分 S2 体验权益,邀请码 SFC4L10XBU。

  3. 公众号:百度智能云(文心)19

    百度超级智能体大会深圳站9月20日议程公布:百度搭子将重磅升级

    超级智能体大会BAIDU AGENT SUMMIT(深圳站)将于9月20日在深圳湾万丽酒店举行,设主论坛、Agent+硬件、Agent+康养三大专题论坛及百度搭子实训营四大场次。主论坛将解读百度搭子重磅升级与开放生态,并邀请猫王收音机、Visa、PandaAX等企业分享AI硬件、智能体支付与AI陪伴落地实践。

  4. 公众号:千问APP(阿里)42

    千问接入人卫医学知识库与 NutriData 营养数据库,健康问答更有依据

    千问新增接入人卫医学专业知识库和 NutriData 营养数据库,前者汇聚人民卫生出版社 70 余年医学资源,覆盖疾病、检查检验、药物等知识,后者由中国营养学会参与共建、基于《中国食物成分表》等数据。接入后,用户询问体检指标、疾病知识或日常饮食时,千问可结合专业数据与个人情况给出解读和搭配建议。

  5. 公众号:蚂蚁百灵(Ling)45

    百灵 OmniTable:面向 PB 级大模型数据治理的统一宽表系统

    百灵发布面向 PB 级大模型数据治理与探索的统一宽表系统 OmniTable,相关论文获 VLDB 2026 最佳工业论文奖。在一项真实 SFT 数据治理任务中,端到端处理周期从约 14 天缩短至约 2.5 天,缩短约 82.1%,人工操作步骤从约 45 个减至约 12 个。

  6. GitHub Blog87

    GitHub 用 Copilot 智能体将 Copilot 运行时从 TypeScript 迁移到 83 万行 Rust

    GitHub 工程师 Stephen Toub 复盘用 Copilot 智能体在约 14.5 周内将 Copilot agent runtime 从 TypeScript/Node.js 全量重写为 832,378 行生产 Rust,AI 智能体完成大部分代码,共 128 个 PR 增量合入 main 并持续发布。

    推荐理由:当事工程师复盘用 AI 智能体在数月内将 Copilot 运行时迁往 Rust 的全过程,策略、回归样本和成本数据对同类迁移有直接参考价值。

  7. Claude Code:GitHub Releases(RSS)42

    Claude Code v2.1.274 发布:新增内存告警与 MCP 启动等待配置

    Claude Code v2.1.274 新增内存占用临界时的可见警告,并提供释放内存或安全重启的步骤,同时加入 CLAUDE_CODE_MCP_STARTUP_WAIT_MS 用于限制首个非交互轮次等待 MCP 服务器连接的时间(0 表示不等待)。

  8. Apple Machine Learning Research(RSS)40

    Apple 与哥本哈根大学研究:价值诱导如何重塑 LLM 行为

    Apple 与哥本哈根大学研究发现,用偏好数据集中的价值子集微调 LLM 会产生连锁效应:诱导某一价值会连带表达其他相关甚至相反的价值。诱导正向价值能提升模型安全性,但所有价值诱导都会增加拟人化语言,使模型更倾向于附和与讨好用户。

  9. LlamaIndex:产品、工程与评测50

    AI 文档抽取:为什么 Schema 才是出错的那一环

    AI 文档抽取的准确率瓶颈不在模型读取,而在 Schema 定义。同一份 180 页信贷协议中利率出现 6.25%、SOFR+350 基点、违约后 11% 三个可读数值,Schema 未说明取哪一个,三个抽取系统就会给出三个不同答案。