跳到正文

#推理

今日 2 条
9月2日周三
  1. Rohan Paul51

    Fable 5.1 的缓存读取成本比 Fable 5 低 75%,随着负载越偏智能体化,节省越大,一项组件的降价可带来整个工作负载约 45% 的成本下降。作者转发分析称,智能体反复回访相同的上下文、计划、工具输出与工作状态,因此更便宜的缓存读取大幅降低持续推理的开销;企业现在面临的经济问题是智能体能持续工作多久才在财务上合理。

  2. SemiAnalysis28

    SemiAnalysis 致谢 AMD 团队在几周内快速提升了 MI355X 在智能体工作负载上的性能,测试基于 Qwen3.5 397B 和 MiniMax M3 等前沿模型的真实生产负载。配图为 SemiAnalysis InMaxM3 数据:在 Qwen3.5 397B FP4 智能体场景下,MI355X(SGLang)2026-08-31 的每 $1 TCO 总 token 产出与 P90 交互速度曲线较 2026-08-12 明显改善,图中 B300 TCO 为 $2.26/chip/hr,MI355X 为 $1.5/chip/hr。

  3. Artificial Analysis 完整文章(网页)66

    Google 发布 Gemini 3.8 Flash,四个月内第四款 Flash 模型

    Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。

    推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。

9月1日周二
  1. IT之家(RSS)52

    百度 CFO 何海建:AI 业务有望很快带来与搜索业务相当的利润和现金回报

    据彭博社报道,百度 CFO 何海建表示,AI 领域的大规模投入有望很快带来与搜索业务相当的利润和现金回报。目前百度 AI 相关收入占公司总收入一半以上,覆盖云计算、应用等领域;支持 AI 服务的新 GPU 集群投资预计两到三年内收回成本,云业务收入未来几个季度的增速至少快于行业平均水平,资本开支低于市场预期。