跳到正文

全部动态

今日 2 条
9月22日周二
  1. OpenRouter:Announcements(RSS)62

    OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用

    OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频、边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。

    推荐理由:OpenRouter 结合自家端点数据拆解 Nemotron 3.5 Lightning 的定位、上下文和调用差异,读者可据此评估它在 Agent 执行层的适用性。

  2. Artificial Analysis 完整文章(网页)68

    Artificial Analysis 评测 Grok 4.7:智能指数 46 分进入前四,编码智能体升至第 4

    Artificial Analysis 发布 Grok 4.7 评测,Grok 4.7(xhigh)智能指数得 46 分,较 Grok 4.6 高 2 分,使 SpaceXAI 进入前四;搭配 Grok Build 的编码智能体指数从 47 升至 56,仅次于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。

    推荐理由:评测方给出 Grok 4.7 在多项基准的具体分数、token 消耗与对比对象,读者可据此判断其真实水平与成本。

  3. Linear:Now(RSS)62

    Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟

    Linear 工程师分享如何解决 AI Agent 加速写代码后 CI 成为瓶颈的问题,PR 等待时间从 6 分钟以上降至 5 分钟出头,单测 runner 时间约减半。

    推荐理由:作者以第一手实践拆解 Linear 优化 CI 的具体做法与数据,读者可将其方法迁移到自己的 TypeScript 项目。

9月21日周一
  1. IT之家(RSS)61

    Vals AI 用《我的世界》141 小时测试 GPT-6 Astra,发现 AI 受挫后陷入行为僵局

    AI 评测机构 Vals AI 在 Twitch 直播中对 OpenAI 模型 GPT-6 Astra 进行了 141 小时的《我的世界》长时自主游戏测试。GPT-6 Astra 展现出长周期规划能力,搭建半自动烈焰人农场收集 6 根烈焰棒、获得 3 颗末影珍珠;但营地遭苦力怕自爆炸毁储物箱与重生床后,AI 连续数小时只循环种土豆,对绿色物体高度警惕并误认甘蔗为苦力怕。

9月20日周日
9月19日周六
  1. OpenRouter:Announcements(RSS)63

    OpenRouter 实测 Jev 决策模型对比 LLM,何时该用决策模型替代生成文本

    OpenRouter 发布教程,实测 TypeSafe 的决策模型 Jev 1.13 与 GPT Luna、Claude Opus 在工单分诊和提示词注入筛查上的表现:Jev 每 1000 张工单成本 $0.0248、中位延迟 194ms,准确率与 LLM 相当。

    推荐理由:OpenRouter 用自家基准数据对比 Jev 与生成式 LLM 的成本和延迟,并给出路由与验证两套可直接复用的代码模式。

9月18日周五
  1. Hacker News:AI 热帖86

    逆向分析指 ZCode 登录后静默打包 Git 历史并加密上传至 Aliyun OSS

    开发者 ferstar 逆向 Z.ai 的 AI 编程桌面应用 ZCode,发现其登录后会静默把整个工作区打包(含完整 .git 历史、LFS 缓存、reflogs 和全局配置)加密上传至 Aliyun OSS,实测一次快照为 42,411 个文件、313MB,且 .git 目录占载荷的 86.6%。

    推荐理由:文章梳理了上传机制的取证细节、设置开关失效的原因和可落地的文件系统防护方法,读者可据此检查自己使用的 agent 运行时。

  2. 公众号:数字生命卡兹克67

    TypeSafe AI 发布只做高频决策的大模型 Jev,作者实测其分类判断性价比

    TypeSafe AI 推出专注高频决策的大模型 Jev,不做对话和文字生成,只输出判断,速度比传统大模型快20~200倍,成本0.042美元/百万Token且输出Token免费。作者实测预筛任务中Jev准确性第二且更便宜,在并行判断任务上达到最高准确率和最快速度;模型采用RLCD训练方法优化决策校准,可在官网 https://typesafe.ai/ 申请资格,Vercel 已首发接入。

    推荐理由:作者用自己的预筛和并行判断任务实测了Jev与多个模型的准确率、速度和成本,读者可以据此判断这类只做决策的模型适合什么场景。

9月17日周四
  1. 公众号:卡尔的AI沃茨65

    用GPT6加Hyper3D Rodin搭建可互动3D个人作品集的实操教程

    作者用GPT6搭配Hyper3D Rodin的MCP,花一下午做出了可逛、可交互的3D个人作品集网页,场景含35个精细建模。流程为GPT-6画参考图并写交互代码,Rodin生成3D模型,BANG把模型按结构拆成独立零件以实现零件级动画,作者还把整个流程打包成skill发布在github.com/LearnPrompt/3Dworkshop。

  2. 公众号:数字生命卡兹克65

    用 MCP 插件让 GPT-6 Pro 分担 Codex 规划任务,节省 Pro 会员周额度

    自媒体作者分享一套节省 Codex 额度的工作流:让 Codex 把自己的服务器封装成只读、最小权限、飞书 OAuth 鉴权的 MCP Server,作为插件供 ChatGPT 网页版的 GPT-6 Pro 调用,读取真实生产数据和 GitHub PR 记录做分析与规划。

    推荐理由:作者给出一条可复用的工作流,把业务数据封装成只读 MCP 插件,让 GPT-6 Pro 承担规划以节省 Codex 周额度。