OpenRouter 实测 Jev 决策模型对比 LLM,何时该用决策模型替代生成文本
OpenRouter 发布教程,实测 TypeSafe 的决策模型 Jev 1.13 与 GPT Luna、Claude Opus 在工单分诊和提示词注入筛查上的表现:Jev 每 1000 张工单成本 $0.0248、中位延迟 194ms,准确率与 LLM 相当。
推荐理由:OpenRouter 用自家基准数据对比 Jev 与生成式 LLM 的成本和延迟,并给出路由与验证两套可直接复用的代码模式。
OpenRouter 发布教程,实测 TypeSafe 的决策模型 Jev 1.13 与 GPT Luna、Claude Opus 在工单分诊和提示词注入筛查上的表现:Jev 每 1000 张工单成本 $0.0248、中位延迟 194ms,准确率与 LLM 相当。
推荐理由:OpenRouter 用自家基准数据对比 Jev 与生成式 LLM 的成本和延迟,并给出路由与验证两套可直接复用的代码模式。
Jina AI 发布端到端视觉文档解析模型 jina-ocr-v1,总参数 3.4B,每 token 激活约 570M,可将 PDF、扫描件、表格和发票一次转成 Markdown。
OpenAI前研究员、RLHF共同发明人Almeida创办的TypeSafe AI发布基于transformer的新模型Jev,它不输出文本而是产生概率形式的校准决策。
PrismML 发布 Ternary Bonsai 2 27B,将 Qwen3.8 27B 转为三值权重,模型仅 5.93 GB(FP16 为 53.80 GB),Apache 2.0 开源,官方称在 20 个基准上保留母模型 98.2% 的平均分,支持文本与图像输入和 262K token 上下文。
OpenRouter 发布教程,讲解如何用其 TypeScript SDK 从零构建工具调用 Agent 循环,示例使用本地天气数据和 google/gemini-3-flash-preview 等模型。
该指南从文档完善度、许可证、维护状态和安全控制等维度盘点 11 个开源 Agent harness,包括 OpenCode、Pi、Goose、Cline、OpenHands、Aider、Codex CLI、Qwen Code、Kilo Code、Hermes Agent 和 OpenClaw。
智谱正式推出 GLM-5.3-FlashX,在 GLM-5.3-Flash 基础上加大对 Infra 侧投入与推理优化,速度最高 200 tokens/s,算力基于 10 万张国产芯片。该模型此前曾以 Ox Alpha 之名面向开发者,官方称其长期保持同尺寸最强智能水平并具备高性价比,API 已上线,Model Key:GLM-5.3-FlashX。
华为云 CEO 周跃峰在华为全联接大会 2026 上宣布,灵衢昇腾 950 智算集群云服务将于 9 月 30 日国内商用,11 月 30 日全球商用。
华为 9 月 17 日在上海发布 AI 时代全新计算架构 Peerium,称基于嵌套并行、统一内存寻址和平等互联,可实现百万级处理器作为一台计算机协同工作。该架构提出 Nested BSP 计算范式,关键互联技术为基于开放协议的灵衢;首代产品为 Atlas 950 超节点,25.6 万卡 Atlas 950 集群已在部署中,基于 NPO 的 Atlas 960 系统正在测试中。
Crusoe 宣布完成 39 亿美元 F 轮融资,估值升至 309 亿美元,由 Atreides Management、Mubadala Capital 和 Valor Equity Partners 联合领投,Nvidia、Founders Fund、GIC 等参投。
AI 实验室 PrismML 发布 Bonsai 2 27B,将阿里开源模型 Qwen3.8 27B 压缩到 5.9 GB,内存较原版减少 9 到 10 倍,可放进 PC 甚至高端智能手机。
微软 Azure Kubernetes Service 团队于 2026 年 8 月 28 日以 MIT 许可开源 TauGrid,一次 Helm 安装即可打包 tau CLI、Kueue 队列、KubeRay 编排、GPU 健康监控和可观测性。
编程语言 Bend 正式推出,定位为通过证明阻断 AI 编码错误的语言,宣称单核接近 C 速度、同一二进制可跑 16 核或 GPU 并达百倍加速。
智谱(Zai)分享 GLM-5.3 帮助构建并优化 GLM-5.3-Flash 推理基础设施的过程,系统从首次成功运行到生产就绪用时不到两周,端到端吞吐相对初始基线提升至 3 倍。
推荐理由:官方介绍了新 Docker 镜像和 Desktop 应用,列出本地训练运行模型的硬件支持与效率数字,读者可据此评估本地部署方式。
华为在 Huawei Connect 大会上宣布,将下一代 Ascend 960DT AI 芯片的发布从原计划的 2027 年 Q3 提前至 2027 年 Q1,称性能将翻倍。
Emerald AI 牵头成立 AI Energy Management Alliance(AEMA),创始成员包括 Google、Nvidia、Anthropic 及 AES、Constellation、National Grid、NRG Energy 等公用事业公司,推动数据中心通过暂停非关键任务、转移计算负载参与需求响应。
Pawprint Studio 的《Aniimo》本周在 GeForce NOW 首发上线,这是一款免费开放世界捉宠 RPG,玩家可用 Aniipods 捕捉 Aniimo 并 Twine 变身,无需等待 45GB 下载即可在 Steam Deck 和新支持的 Firefox 浏览器上串流。
智谱(Z.ai)发布技术长文,讲解 GLM-5.3 驱动的 Infra Agent 如何在 100,000 多颗国产 AI 加速器上从零搭建 GLM-5.3-Flash 的生产级推理系统,不到两周将端到端吞吐提升约 3 倍,支撑 1M token 上下文与多模态请求。
TypeSafe 发布开源浏览器智能体 Jev Ultrafast,采用动态、带索引的动作空间,每次决策只发一次网络请求,小 LLM 仅在 TYPE_TEXT 操作时生成文本。
智谱 GLM 团队披露递归自我改进方向首个工程化实践,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化。
唐杰撰文称,GLM-5.3 驱动的 Infra Agent 用两周时间让 GLM-5.3-Flash 在国产加速器上从首次运行到承接全部生产流量,端到端吞吐达 3.2 倍。
GitHub 项目 jevlike 发布一个独立起步模型,输入一段文本和 N 个文本选项,单次前向即返回每个选项的概率,输入输出形状与 TypeSafe 未公开设计的商用模型 Jev 相同。
华为全联接大会 2026 上,汪涛宣布基于昇腾 960 芯片和 Hi-ONE 打造业界首个采用 NPO 技术的超节点,单节点 4096 卡规模,最大提供 8E FP8 算力和 1PB HBM 容量,用 5500 个 Hi-ONE 替代 4.8 万颗 800G 光模块,降低超 550 千瓦功耗,系统可用度达 99.8%。
华为轮值董事长汪涛在华为全联接大会 2026 上表示,昇腾 960 芯片提前就绪,实现性能翻番。昇腾 960DT 将于 2027 年 Q1 发布,比原计划提前三个季度;960PR 将于 2027 年 Q3 发布,提前一个季度;后续昇腾 970 计划 2028 年、昇腾 980 计划 2029 年发布,坚持一年一代节奏。据此前预告,昇腾 960 原计划 2027 年 Q4 发布。
据财联社报道,华为副董事长、轮值董事长汪涛 9 月 17 日在上海华为全联接大会上介绍智能时代部署,称华为 AI 战略核心是算力、坚持硬件变现,并以超节点加集群打造算力底座。
数据分析公司 Silicon Data 数据显示,英伟达 B200 出货约一年后二手残值涨至原价的 158%,A100 与 H100 残值也远超 3 年或 5 年直线折旧应有水平。
GitHub 工程师 Stephen Toub 复盘用 Copilot 智能体在约 14.5 周内将 Copilot agent runtime 从 TypeScript/Node.js 全量重写为 832,378 行生产 Rust,AI 智能体完成大部分代码,共 128 个 PR 增量合入 main 并持续发布。
推荐理由:当事工程师复盘用 AI 智能体在数月内将 Copilot 运行时迁往 Rust 的全过程,策略、回归样本和成本数据对同类迁移有直接参考价值。
NVIDIA 宣布押注 Rust 原生 GPU 编程,将 CUDA Rust 发展至 2027 年及以后,提供 cuda-oxide(SIMT,需 pinned nightly)和 cutile-rs(Tile,stable Rust 1.89+、CUDA 13.3)两条路线,GPU kernel 可直接编译到 PTX 而非包装其他语言。
论文提出 BITCOS,一种由存在位图加压缩符号向量组成的三值 LLM 权重布局,按零密度 z 计成本为 2−z bits per weight。作者实测 29 个三值模型发现零权重占比最高达 51.5%,其中 26 个模型的存储比 five-trit packing 更紧凑,最稀疏模型达 1.485 bits per weight。
据 The Information 报道,Apple 正开发面向 AI 开发者、企业和政府的企业级服务器,将推出双芯片或四芯片 M8 Ultra 两个版本,用于运行已训练模型的 AI 推理。
Epoch AI 升级其 AI Data Centers 探索器,覆盖从 13 座数据中心(约 15% 全球 AI 算力)扩展到 86 座(约 44%)。每个站点提供卫星影像和 H100 等效算力、芯片类型、资本开支、建设状态等数据;2026 年至今已捕获约 53% 的新部署算力,估算方法与代码已公开。
据 The Information 援引知情人士报道,苹果筹划推出搭载自研芯片的企业级 AI 服务器,基础版配备 2 颗 M8 Ultra 芯片,高配版 4 颗,并考虑采用英伟达 NVLink Fusion 实现芯片互连。
由 ChatGPT 联合发明人 Diogo Almeida 创办的 TypeSafe 结束隐身模式,发布专用于程序化决策的 System One Model Jev。
Nums AI 发布预训练表格基础模型 Causilo,支持分类和回归,在 TabArena 单模型中取得最高 Elo,总体 1792.9,领先 Google Research 的 TabFM(1764.4)和 EXAONE Tabular(1758.8)。