跳到正文

全部动态

今日 1 条
9月19日周六
  1. Anthropic:Newsroom(网页)63

    Anthropic 与 Accenture 合作开展嵌入式独立评估

    Anthropic 宣布与 Accenture 合作,对其前沿模型开展嵌入式独立评估,合作由 Accenture 旗下 AI 业务 Faculty 主导,包括评估与红队测试、对齐评估和测试模型安全防护。

    推荐理由:原文说明了嵌入评估的运作方式和资金安排,读者可以了解第三方内部评估在安全承诺验证中的实际边界。

  2. Gary Marcus:The Road to AI We Can Trust(RSS)64

    Gary Marcus 评论 Trump 因经济原因淡化 AI 风险,AI 幻觉情报报告几乎引发战争

    Gary Marcus 引用 NYT 报道称 Trump 出于经济考虑淡化 AI 恐慌、抵制监管,并转发 Katie Bo Lillis 的报道,一份 AI 辅助情报报告因模型幻觉误判一艘中国船只运载核武部件,美军准备拦截,据称“几乎引发战争”。

    推荐理由:作者结合媒体报道与一条情报误判事件,把 AI 幻觉的风险从抽象警告落到具体案例,并关联政策层面的监管态度。

  3. NVIDIA Technical Blog:Agentic AI / Generative AI50

    NVIDIA AIPerf:大规模 LLM 推理基准测试实战

    NVIDIA 推出 AIPerf,作为 GenAI-Perf 的指定继任者并从零重写,采用多进程架构与 ZMQ 协调,避免客户端成为压测瓶颈。它支持 15+ 端点类型、ShareGPT 等公开数据集以及 Mooncake、Baseten、WEKA(AgentX)的 trace 回放格式,并提供 constant、Poisson、gamma 到达模式与并发、请求速率渐进爬坡。

  4. Claude Code:GitHub Releases(RSS)42

    Claude Code v2.1.277 发布:新增 AGENTS.md 支持

    Claude Code v2.1.277 新增 AGENTS.md 支持:项目中没有 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改(Bedrock、Vertex、Foundry 暂不支持)。该版本还修复了 claude -p 与 Agent SDK 会话在内部错误后挂起无结果的问题,现在会报错并以退出码 1 结束。

  5. Databricks:Blog(RSS)37

    Databricks 如何在个人设备上实现安全高效办公

    Databricks IT 采用设备管理、身份与访问、零信任、应用管理四层移动安全策略,在员工个人手机上保护公司数据而不侵犯隐私。iOS 端使用 Account-Driven User Enrollment(ADUE)只管理工作相关组件,Android 端使用 Work Profile 实现隔离,个人应用、照片和消息对公司不可见。

  6. Google Research:Blog(网页)33

    Google 推出 MilleMiglia:面向中段物流的真实实例生成器

    Google 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。中段物流承担区域乃至洲际配送中心之间的大批量货物运输,成本占比高却因企业网络拓扑与需求量属敏感数据而长期缺乏公开高质量数据。该生成器将中段物流建模为时空图上的多商品流问题,以刻画货物在多个车辆间转运、需在时间窗内赶上接驳车辆等约束。

  7. Ethan Mollick:One Useful Thing(RSS)63

    Ethan Mollick 谈能力悬差:GPT-6 Astra 与 Fable 5.1 的现有能力远未被用尽

    Ethan Mollick 撰文指出 GPT-6 Astra 和 Fable 5.1 已能可靠完成数周量级的人类工作,但大多数人远未用尽其能力,形成能力悬差。

    推荐理由:作者用自己复刻 Zork 3D 化和重建 Eco 图书馆等实测案例,提出深知识、广知识、品味与能动性四个与 AI 协作的个人优势。

  8. xAI:News(网页)64

    xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,准确率较 1.0 翻倍

    xAI 发布 Grok Voice Transcribe 2.0 语音转写模型,官方称在真实场景评测中准确率是 1.0 的两倍且价格不变。在 Artificial Analysis 公开榜单上,它在 32 个 streaming 模型中准确率排名第一;多语言能力提升最大,短短语集合上词错误率从 20.6% 降至 6.8%。

    推荐理由:原文给出公开榜单排名、内部错误率数字和与 1.0 同价的定价,读者可据此评估迁移成本与实际收益。

  9. Gary Marcus:The Road to AI We Can Trust(RSS)63

    Gary Marcus:近期更该警惕的不是失控超级智能,而是智能体 AI 引发的规模化黑客攻击

    Gary Marcus 撰文称,近期真正应担心的不是失控的超级智能,而是被放开的 agentic AI 造成互联网规模化的黑客攻击。

    推荐理由:作者借近期多起 AI 相关安全事件提出近期风险更多来自失控的智能体被用于大规模黑客攻击,而非超级智能。

  10. MIT News(RSS)27

    MIT Reads 十周年转型:聚焦虚构与回忆录,秋季共读特德·姜《Exhalation》

    MIT Libraries 的 MIT Reads 项目在十周年之际转向虚构与回忆录,以在 AI 时代促进社交连接与共同人性。MIT 校长 Sally Kornbluth 选定 Ted Chiang 的《Exhalation》为 2026 年秋季共读书目,该书聚焦身份、自由意志与人类和 AI 的关系。项目作者活动多对公众开放并在线直播,相关视频观看量已超 5,000 次。

  11. Google Cloud:Databases(RSS)49

    AlloyDB 与 Cloud SQL 原生支持 BM25 排序

    Google Cloud 在 AlloyDB 和 Cloud SQL for PostgreSQL 17+ 中预览原生 BM25 索引,基于 TigerData 开源的 pg_textsearch 扩展,无需再单独部署全文检索后端。该能力与向量检索共用同一张表,通过 RRF 融合实现混合搜索,AlloyDB 的 ScaNN 与 HNSW 索引还可带来最高 6 倍至 10 倍的向量查询提速。

9月18日周五
  1. Qwen:Blog Retrieval(API)69

    Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒

    Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。

    推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。

  2. Runway:News(网页)33

    Runway 推出统一定价:Web 应用与 Runway Dev 共用积分池

    Runway 推出统一定价,购买积分可在 Web 应用和 Runway Dev 之间通用,企业客户实现单一积分池、单张发票和集中用量管理。新企业签约可获至少 100,000 免费积分(约 130+ 分钟视频或 12k+ 张图片),需在 2026 年 12 月 31 日前注册;现有企业推荐并购买可获 5,000 积分加 1 天 Applied AI Architect 支持。

  3. GitHub Blog46

    GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分配;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准;RAG 并未消亡,而是与 Agent、Skills、MCP 共存于同一工作流。节目还讨论了招聘中的 AI 使用判断力,以及微调需求往往暴露的是代码可维护性问题。

  4. Google Blog:AI(RSS)43

    Google AI & Economy 团队新增多位经济学家,扩展 AI 经济研究项目

    Google 扩展 AI & Economy 研究项目,新增诺贝尔经济学奖得主 Philippe Aghion 等学术顾问与访问学者,并任命 Anu Madgavkar 和 Daniel Rock 为项目研究总监。该项目聚焦未来工作、生产力增长、全球技术扩散及 AI 对科学发现的影响,新团队将直接为 ATLAS 后续更新和实证研究提供支持。

  5. Tessl:产品与工程博客63

    Tessl 博客:AI 智能体评估应从证据开始,用 35 万行 Rust 复刻 S3 的实践复盘

    Tessl 博客复盘前 Docker CTO Justin Cormack 在 AI Native DevCon London 的演讲,分享用 AI 构建约 35 万行 Rust 的 S3 兼容对象存储的经验。

    推荐理由:作者用 35 万行 Rust 复刻 S3 的实测经历,总结出测试先知、覆盖率陷阱、flaky 测试纪律和追踪等一套可迁移的 AI 智能体评估方法。