跳到正文

全部动态

今日 0 条
9月22日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)44

    OpenAI Academy 扩展新学习路径,覆盖开发者、领导者、教育者和大学生

    OpenAI 扩展 OpenAI Academy,新增面向开发者、领导者、教育者和大学生的课程,与 Apply AI at Work 共同组成按角色划分的学习路径。开发者课程围绕 Codex 和 OpenAI API,涵盖解决方案设计、评估、智能体与生产运维;学习者通过课程评估后可获得 OpenAI Academy 课程徽章。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)57

    OpenAI 提出由美国主导制定前沿 AI 国际标准,覆盖 RSI 与事件报告

    OpenAI 发文提出应为下一阶段 AI 发展建立国际技术标准,重点覆盖递归自我改进(RSI)的风险管理。文章主张由美国借助 CAISI 和各国 AI 安全研究所网络推进标准制定,并建立 RSI 进展评估、人类监督和事件报告的共同协议;同时明确表示完全自主的 RSI 目前并未发生,在无法安全保证人类控制之前不应推进。

  3. LangChain:Blog(RSS)32

    LangSmith 上线 Jev-as-a-Judge 评估功能

    LangSmith 现已支持将 Jev 用作评估裁判(Jev-as-a-Judge),可对智能体 trace 进行结构化反馈评估,覆盖生产运行、数据集与回归测试场景。官方称该方式更快、更便宜。

  4. Tomer Tunguz 博客(VC 分析)66

    Tomer Tunguz 谈 AI 优化 if-then 判断:专用决策器把分类成本降近百倍

    Tomer Tunguz 撰文提出最新一波 AI 正在接管软件中的 if-then 判断原语,Jev 与 SemIf 这类专用决策器以数百毫秒返回结果,成本比传统生成式调用低约 76x 到 209x。作者在自己的 Agent 中替换了约四分之一的调用,在 98 条人工核验的生产邮件线程上,Jev 达到 80%、本地 SemIf 达到 82% 的分类准确率,高于生产模型的 47%。

    推荐理由:作者结合自身 Agent 的替换实验给出成本与准确率对比,为判断专用小模型何时可替代前沿模型提供参照。

  5. Fireworks AI(网页)61

    Fireworks AI 推出 Specialized Intelligence Index 领域基准索引

    Fireworks AI 推出 Specialized Intelligence Index(SII),汇集开放、闭源与专用模型在真实工作任务基准上的表现,首批覆盖医疗、法律、网络安全、金融、客服、生产力和软件七个领域。

    推荐理由:Fireworks 联合多家行业实践方推出领域基准索引,不做跨领域综合排名,读者可按成本和时长自行权衡模型选择。

9月21日周一
  1. xAI:News(网页)74

    xAI 发布 Grok 4.7,主打编码与知识工作

    xAI 发布 Grok 4.7,定位为其最强编码与知识工作模型,定价 $2/百万输入 token、$6/百万输出 token,与 Grok 4.6 同价同速,另有速度和价格加倍的快速变体。

    推荐理由:官方给出了完整定价、速度和多项基准对比,读者可以据此把 Grok 4.7 放进现有模型选型里横向比较。

  2. Hugging Face:Blog(RSS)46

    Hugging Face tokenizers v1:编码、解码与扩展性能实测

    Hugging Face 发布 tokenizers v1,输出 token ID 与 v0.23 完全一致,但速度常达 v0.23 的数十倍。v1 将单个 crate 拆为 workspace,用 SIMD 位流拆分(bitcannon)替代正则引擎,并引入无分配合并模型、合并循环重写、线程本地词缓存和原生多线程并行。

  3. Hugging Face:Blog(RSS)47

    Multiverse 将 LLM 块删除重构为 Ising 优化问题

    Multiverse 提出将 LLM 整块删除重构为受限二元优化问题,等价于求解 Ising 玻璃的低能态,从而无需跑 benchmark 即可筛选候选配置。在 Llama-3.3-70B-Instruct 压缩 50% 时,该方法在 MMLU 上比最佳同类块删除方法高出近 23 个百分点。

  4. Tessl:产品与工程博客21

    Tessl 完成 SOC 2 Type II 审计

    Tessl 宣布已完成 SOC 2 Type II 审计,报告由独立审计机构 A-Lign 出具,覆盖访问控制、持续监控与事件响应、员工安全意识培训及安全软件开发等控制项。Tessl 表示正推进 ISO 27001 认证,内部审计本月启动、外部审计在 11 月进行,客户可通过 Tessl Trust Center 申请完整报告。

  5. OpenAI:官网动态(RSS · 排除企业/客户案例)36

    V7 如何为 AI 智能体提供企业级记忆

    V7 推出 V7 Go 智能体平台,通过 Context Graph 将企业文件转化为智能体可查询的记忆,其最难的图查询测试中 GPT-6 Astra 准确率达 89%。平台用 GPT-5.6 Luna 做结构化抽取、GPT-5.6 Terra 和 Sol 负责推理与工具调用,在 HERB 基准上检索系统比官方基线高 69%、不可答查询的幻觉减少 38%。