CUDA for AMD on Windows:基于 ZLUDA + HIP/ROCm 在 Windows 上运行 CUDA 应用的开源方案
GitHub 项目 CUDA-for-AMD-Windows 发布了可复现的技术栈,通过 ZLUDA v6-preview.69 + AMD HIP SDK 6.4 让 CUDA 面向的 Windows 应用在 AMD GPU 上运行。
GitHub 项目 CUDA-for-AMD-Windows 发布了可复现的技术栈,通过 ZLUDA v6-preview.69 + AMD HIP SDK 6.4 让 CUDA 面向的 Windows 应用在 AMD GPU 上运行。
文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。
推荐理由:文章把解决长任务中上下文溢出与目标丢失的机制拆成四类,并对照多款主流 Agent 产品的具体实现和阈值,便于读者迁移到自己的系统。
MarkTechPost 发布一篇教程,用 NVIDIA cuML 和 RAPIDS 构建覆盖 GPU 加速机器学习全流程的可运行工作流。
Simon Willison 用 GPT-6 Astra 和 ChatGPT Work 从家出发生成 5K 和 10K 环形跑步路线,运行 27 分钟,基于 Nominatim 定位地址、Overpass 下载 OpenStreetMap 道路数据,产出嵌入式地图可视化和可下载的 GPX 与 GeoJSON 文件。
vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。
Fireworks 发布 2026 年开源 LLM 选型指南,覆盖 GLM 5.2、Kimi K3、Kimi K2.7 Code、DeepSeek-V4-Pro/Flash、MiniMax M3、Qwen3.7 Plus、gpt-oss-120b 和 Gemma 4 31B IT 九款模型。
OpenAI 的 Eric Provencher 撰文建议,切换到 GPT-6 Astra 时应精简技能描述、AGENTS.md 规则和任务提示词,因为过长的指令会占用上下文或导致模型过早停止。
OpenAI 公开了 ChatGPT 背后的存储系统 Habitat,它每秒处理超过 7000 万次请求、保存 500PB 以上数据、服务每周超过 10 亿用户,最早只是一个 Python 小库。
作者曾是逆向 ANE Linux 驱动的开发者,三年后重新逆向 M1 上的 Apple Neural Engine,完整测绘其 16 计算核、2048 条 MAC 通道、任务描述符调度和内存层级。
Google 的 Gleb Otochkin 在 AlloyDB Omni 上实测嵌入向量版本更新对 PostgreSQL 存储的影响:在含 768 维向量和 HNSW 索引的 20k 行表上更新全部向量后,表、TOAST 和索引体积几乎翻倍(TOAST 从 81 MB 到 159 MB,HNSW 索引从 78 MB 到 156 MB),约一半空间被死元组占据。
Epoch AI 发布对 ExploitBench v0.1 的基准评审,该基准用 41 个真实公开 V8 CVE,按 5 层 16 项可验证能力阶梯为模型打分,最高到任意代码执行(ACE)。
推荐理由:Epoch AI 独立评审 ExploitBench 的评分设计与局限,读者可借此理解如何解读该基准的模型分数与污染风险。
Simon Willison 转述 Mohamed Moustafa 对 OpenRouter 自动路由的问题分析。不同供应商的推理软件、优化设置不同,同一端点可能行为不一致,部分供应商的视觉模型缺少视觉能力,reasoning effort 参数的处理方式也有差异。可用 provider.only 指定供应商,并通过 /endpoints 方法查询某模型可用供应商列表。
GitHub 日韩地区营销负责人 Tomoko Tanaka 分享如何不写代码,把活动运营交给 GitHub Copilot 自动化。
推荐理由:作者以自身营销工作为例,展示了用 Issue、Actions 和 SKILL.md 复用开发者治理流程落地自动化的完整路径。
Earendil 工程师发文讨论如何量化 LLM 生成代码的粗糙程度,指出 AI as a judge 很难有效评估代码质量,而 LOC 变化、verbosity 和 erosion 是更可行的指标。
Google 发布 autofinetune 项目,把 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和 GRPO),使用 Tunix、Gemma、Cloud TPU,由 Antigravity CLI 和 Gemini Flash 3.7 编排。
OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音服务,一个 API key 可调用多家供应商的 TTS 模型。
Quesma 在 Terminal-Bench 2.1 上用 Claude Code(Fable 5.0)和 OpenCode(DeepSeek V4 Pro 0813)实测 RTK(Rust Token Killer),共 1740 次尝试、花费超 1500 美元,结论是 RTK 并不普遍降低成本。
作者用同一台 M4 MacBook Pro(24GB)和 llama.cpp 服务 Qwen 3.8 27B,对 9 套编程线束跑 8 道 Exercism 题目实测。
作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。
推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。
OpenRouter 发布 Presets 使用教程,preset 是一个命名且带版本的配置,统一存放模型或 fallback 列表、system prompt、provider 路由和采样参数,在任何请求中以 "model": "@preset/名称" 引用。
GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。
Google AI 的 Tilde A. Thurium 发布访谈视频,请 Annie Wang 从头讲解图工程(graph engineering),以及它如何让开发者掌控复杂 AI 系统。
Every 介绍了为什么要为每位员工构建个人基准(personal benchmarks),并说明如何开始按照自己的标准测试 AI 的表现。文章兼具动机阐述与可上手的实践指引。
The Verge 作者实测 Meta 新推出的 AI 智能体 Muse,它基于云端虚拟电脑执行任务,成功清理了数千封推广邮件并按指定要求完成 Amazon 购买,也能生成 AI 播客、图像视频和名为 artifacts 的交互网页。
LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。
推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。
推荐理由:原文给出完整的 12 步 3D 角色制作工作流和截图生成参考图的修正方法,Blender 初学者可以照着复用。
作者 Hugo Vergnes 用租用的 8× B200 在 43 小时内以 $998 训练了 3.8B 参数模型 little-lm,在 65.3B tokens 上达到 CORE 0.384,超过 GPT-2 1.5B 的 0.2565。
美团龙猫LongCat团队推出《Agent评测白皮书》系列博客,首篇《评测全览》体系化讲解Agent评测落地方法,计划共4篇,后续将覆盖冷启动、扩量和自进化。文章提出评测体系可概括为四个模块(离线评测、在线评测与监控、Case挖掘与归因、观测基建)、三种能力、两条Loop和一套评测资产,以商家经营分析Agent为贯穿案例,并附评测体系成熟度自查表。
作者实测网易有道新上线的语音输入法叭哥说,与 Typeless、豆包输入法、闪电说横向对比。叭哥说采用双模型分工,E2E 平均 1683ms、P95 2134ms,并支持小声拾音、个人词典即刻生效和多语言翻译等功能。
Epoch AI 对基于 OpenAI HealthBench 的 HealthBench Professional 基准发布评测,从 525 个任务中分层随机抽样 50 个。
推荐理由:Epoch AI 抽检了 OpenAI HealthBench Professional 的任务质量,读者可以据此看待该基准分数的可靠性。