vLLM 推出 Hybrid HiSparse 优化,让 GLM 5.3 在单节点 8× H200 上跑满 100 万上下文
vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。
vLLM 团队为 GLM 5.3 引入 Hybrid HiSparse 混合稀疏卸载,在单个 8× H200 节点上首次实现 100 万完整上下文长度推理。该方法仅在 KV cache 压力出现时才将 top-K 之外的 KV 卸载到 CPU,热页与常驻页共享同一块池和张量,无需抢占或重新 prefill。
很高兴能与这个出色的社区一起建设 @KanishkaNarayan 🇬🇧 欢迎来到英国和你们的欧洲中心,@Replit 团队! 英国的 AI 生态系统正在为我们的年轻人创造更光明的未来 🇬🇧
Omarchy 是首个从头为智能体打造的操作系统。 Omarchy 正通过 OpenRouter 路由所有赞助 token。
美食很棒。短暂飞往纽约、德国和伦敦。Geoffrey Hinton。 据 @CNN 报道,多伦多机遇众多,正迅速成为领先的 AI 中心。我们自 2019 年起就在这里建设。名副其实,并非新事 🇨🇦
Preferred Networks(PFN)与德勤汤姆茨合作,承接日本国土交通省基础设施领域业务,开发并验证支援发注业务与技术提案审查的 AI 智能体。该智能体结合 VLM 与 LLM,跨模态解析图纸、数量总括表、特记仕样书三类发注文书并验证一致性,同时支援业务实绩核对与提案书整理,采用 Human-in-the-Loop 设计,计划 2027 年 3 月完成业务。
Cognition 宣布完成超 20 亿美元 E 轮融资,估值 480 亿美元,由 Andreessen Horowitz 和 Accel 领投,Founders Fund、General Catalyst、Avenir 等跟投。
推荐理由:官方公布融资规模与估值的同时给出营收增速和产品进展,读者可以据此了解 Devin 的商业化落地情况。
我们在8月交付了很多东西。 新模型、重建的 Gallery、更顺畅的 DCC 工作流、3D Viewer 支持 20+ 格式,以及更快的 FBX 导出。 基本上就是:更多创作方式,更少事后清理。
何必在 6 个不同模型之间来回切换?在一个地方就能全部用上。我们也讨厌这种杂乱,于是打造了这个一体化工作区——你可以在 WorkBuddy 内直接挑选具体模型,并在同一任务中随时切换。
@sayaka_aiart 带来的一个角色创作流程的优秀范例。用 Tripo 生成基础模型,再用 Astra 制作面部表情和头发物理效果,是很聪明的做法。
OpenAI 联合 WAN-IFRA 与乌克兰独立地区新闻出版商协会(AIRPPU)宣布新项目,通过 Newsroom AI Masterclass Series 和 Newsroom AI Catalyst 帮助乌克兰新闻机构提升 AI 应用能力。
WorkBuddy 变得更互联了。🔌 推出 3 个新连接器:富途牛牛 × 可灵 AI × TikTok for Business。更多工具。更少标签页。一个 WorkBuddy。
Meshy 7 真正懂 3D 里的对齐是什么意思。😎 让 GPT-6 负责推理部分。Meshy 7 负责网格。 你上传什么,就得到什么。
Epoch AI 用 Opus 5 和 Sol 5.6 扫描 DeepSWE v1.1 全部 113 个任务,在 23 个(超 20.3%)任务中发现假阴性错误,据此将该基准判定为 Flawed。其中 18 个(78%)源于模型修改现有测试文件,而验证器会丢弃这些改动并注入隐藏测试,导致符号重复定义或引用失效、测试包编译失败。
vLLM 推出 TT Plugin,通过 out-of-tree 平台插件机制将 Tenstorrent 加速器接入 vLLM,安装后只要 TT-Metal 的 ttnn 可导入即自动注册为 vLLM 平台,OpenAI 兼容 API 与客户端代码保持不变。
VC Tomer Tunguz 提出 AI token 消耗分三波:聊天约 1m tokens/人/天,单智能体约 100m–200m tokens/天,meta-harness 并行调度多智能体可达数十亿。
推荐理由:作者提出 AI 消耗分三波叠加增长的框架,并用 OpenRouter 与企业数据解释为何线性外推算力需求会失真。
Gary Marcus 撰文批评 Jensen Huang 宣称 AGI 竞赛已结束,指出其未给出证据和定义,并建议其参考 Hendrycks、Yoshua Bengio 等人参与的 agidefinition.AI。
@foundherhouse 的女性创始人正在利用 AI 在奖学金、个人理财和机器人领域进行创新,我们期待看到她们接下来的成果。
OpenAI 发布长文《An Alien Mind》,回溯 2023 年 RLSlow 项目中确认推理模型可扩展训练的起点,并系统阐述目标对齐与价值对齐的区分。文章指出链式思维监控的效果正随着模型能力提升而逐步减弱,GPT‑6 Astra 在对齐上显著优于 GPT‑5.6 Sol;作者预期进展可能持续走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。
推荐理由:作者以内部视角回溯推理模型的起源,并给出对齐监测、CoT 监控弱化和 RSI 风险的一手判断。
在终端设备上运行领域增强模型的AD量化版本?我们可以在其上构建太多有趣场景了!感谢我们的day0合作伙伴@atomic_chat_hq让这一切成为现实~ 😎