跳到正文

全部动态

今日 14 条
9月22日周二
  1. 腾讯混元:Research(API)60

    腾讯混元发布 Hy Image3.5 preview 图像生成模型

    腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。

    推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。

  2. Artificial Analysis65

    Artificial Analysis 评测阶跃星辰 Step 5 Preview,其在 Artificial Analysis Intelligence Index 得 44 分,与 Kimi K3 (max) 持平,略低于 GLM-5.3 (max) 和 Qwen3.8 Max 的 45 分,每任务成本约 $0.72,约为同级模型(约 $2.00)的 1/2.8。

    推荐理由:Artificial Analysis 实测 Step 5 Preview 的得分、成本与智能体短板,读者可据此对比同分段模型的表现与性价比。

  3. OpenRouter:Announcements(RSS)62

    OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用

    OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频、边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。

    推荐理由:OpenRouter 结合自家端点数据拆解 Nemotron 3.5 Lightning 的定位、上下文和调用差异,读者可据此评估它在 Agent 执行层的适用性。

  4. 小米 MiMo:官网发布与博客20

    小米 MiMo-V2.6-Pro 如何提升新材料研发效率

    小米 MiMo-V2.6-Pro 面向新材料研发场景,覆盖从文献综述到分子设计,再到 PFAS 捕获的自动化干实验室实验。该模型旨在提升新材料研发流程中的生产力。

  5. Gary Marcus:The Road to AI We Can Trust(RSS)51

    Gary Marcus 在联合国大会数字合作活动发表 AI 治理演讲,多国同期签署前沿模型管控呼吁

    Gary Marcus 在联合国大会数字合作活动(与 Yoshua Bengio、Nobel 得主 Maria Ressa 同场)发表演讲,称近期风险不是灭绝或超级智能,而是深度伪造虚假信息、不可靠 AI 系统窃取凭证和大规模网络攻击,主张提升可靠性、网络安全与真实执法,批评 OpenAI 发布比前代更难监控的新模型。

  6. NVIDIA Technical Blog:Agentic AI / Generative AI50

    NVIDIA 详解 AI 智能体评估:从工具调用到任务完成

    NVIDIA 发文梳理 AI 智能体评估如何从单次函数调用打分演进到整任务打分,指出 BFCL 只评估单次调用,调用准确率必要但不充分。完整评估需要可执行环境,配合步骤级过程打分与端到端结果打分,核心指标包括任务成功率、一致性、工具调用精度、参数准确率、每成功任务步数与成本。

  7. Xiaomi MiMo73

    小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两个全模态模型,通过规模化强化学习训练。Pro 在多数 Agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。

    推荐理由:官方发布全模态模型并开放权重、技术报告和训练代码,附与 Claude Opus 5、GPT-5.6 Sol 的 Agent 基准对比数据。

  8. OpenAI:官网动态(RSS · 排除企业/客户案例)29

    Higgsfield AI 借助 GPT-6 Astra 一天内上线新视频功能

    Higgsfield AI 借助 GPT-6 Astra 在一天内交付新的视频探索功能,且仅由一名工程师完成。该模型的长程任务规划能力可跨多步骤安排工作,帮助 Higgsfield 更快将创意工具推向市场。用户只需一句提示词,就能把一条表现最佳的广告生成 100 个新变体,并按不同国家定制,方便小企业制作视频广告。

  9. Artificial Analysis 完整文章(网页)68

    Artificial Analysis 评测 Grok 4.7:智能指数 46 分进入前四,编码智能体升至第 4

    Artificial Analysis 发布 Grok 4.7 评测,Grok 4.7(xhigh)智能指数得 46 分,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四;搭配 Grok Build 的编码智能体指数从 47 升至 56,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。

    推荐理由:评测方给出 Grok 4.7 在多项基准的具体分数、token 消耗与对比对象,读者可据此判断其真实水平与成本。

  10. Linear:Now(RSS)62

    Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟

    Linear 工程师分享如何解决 AI Agent 加速写代码后 CI 成为瓶颈的问题,PR 等待时间从 6 分钟以上降至 5 分钟出头,单测 runner 时间约减半。

    推荐理由:作者以第一手实践拆解 Linear 优化 CI 的具体做法与数据,读者可将其方法迁移到自己的 TypeScript 项目。