跳到正文

#推理

今日 2 条
9月24日周四
  1. HuggingFace Daily Papers(社区热门论文)53

    Hunyuan-A13B 技术报告发布:80B 总参数、13B 激活的开源 MoE 模型

    腾讯混元发布开源 MoE 大语言模型 Hunyuan-A13B,总参数 80B、推理仅激活 13B,以平衡能力、效率与部署成本。模型在经严格筛选的 20T token 语料上预训练并加强 STEM 数据,再经 SFT 和大规模强化学习;引入双模式 Chain-of-Thought 框架,简单问题用快思考、复杂多步问题用慢思考。

  2. HuggingFace Daily Papers(社区热门论文)38

    SAGE:通过拓扑引导缓解长程推理偏差

    研究者提出 SAGE(Structural Admissibility-Guided Exploration)框架,通过代数稀疏化与双曲结构引导两种结构先验,缓解长程推理中的探索偏差与累积偏差。在 12 个基准、7 个模型族上,SAGE 优于竞争基线,在 Andrews-Curtis 问题上取得最高 8 倍提升。代码已开源。

9月23日周三
  1. The Decoder:AI News(RSS)68

    阿里 Qwen 发布 Qwen-Audio-3.1 五款语音模型,语音价格最高下调 95%

    阿里 Qwen 团队发布 Qwen-Audio-3.1,包含五款覆盖语音识别(ASR)、语音合成(TTS)和实时交互的模型。ASR 改进多语言和方言识别并自动清理填充词,ASR-Next 支持多说话人识别、时间戳及情绪和环境声检测;TTS-Next 将语言模型与扩散方法结合,可一次性生成语音、音效和背景音频。同步降价:TTS 约 70%,Realtime 约 85%,ASR 最高 95%。

  2. Hacker News 热门(buzzing.cc 中文翻译)73

    OpenAI 纳维-斯托克斯解法遭质疑:解的是带外力的问题变体

    OpenAI 用内部 LLM 生成纳维-斯托克斯问题的证明后,数学界指出其解法依赖外部力项这一漏洞,偏离了数学家真正关心的无外力版本。上周四三位数学家发文证明去掉外力后爆炸消失,OpenAI 的方法无法扩展到完整问题,但按 Clay Institute 2000 年原始表述的选项 C,其解法成立。

  3. HuggingFace Daily Papers(社区热门论文)53

    Learning to Discover Interesting Mathematics:用有趣度指标引导模型自动发现数学定理

    论文提出用证明长度与陈述长度之比衡量定理的内在有趣度,并证明其与下游实用性相关。作者训练了一个 27B 模型预测证明难度,准确率超过前沿通用模型;按该指标优化后,生成定理与 Mathlib 的实质性或完全重合率从 91.9% 降至 30.6%,系统可迭代构建自扩展的机器验证数学库。

  4. Epoch AI:研究、数据与评测66

    Epoch AI 研究报告:达到同等 AI 性能的成本每季度下降约 47%

    Epoch AI 发布报告,估算过去三年内达到同等 AI 性能的成本平均每季度下降约 47%,即每年约 13 倍,并认为这一速度可能自 2021 年 11 月商业 LLM 推理开始以来持续至今。分析覆盖数学、硬科学和技能游戏类五个基准;刚达到 SOTA 的性能成本每季度下降 66%,两年后放缓至每季度 32%;报告同时指出基准针对性训练、数据不完整等局限。数据与代码在 GitHub 上公开。

    推荐理由:报告用五个基准三年数据量化达到同等性能的成本下降速度,还区分了刚成为 SOTA 与两年后两种情形,数字和方法都值得细看。

  5. OpenAI:官网动态(RSS · 排除企业/客户案例)82

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。

    推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。

  6. Anthropic:Newsroom(网页)91

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。

    推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。

9月22日周二