MacStories 主编汇总 iOS / iPadOS 27 的 54 项隐藏新功能
MacStories 主编 Federico Viticci 发布博文,汇总 iOS / iPadOS 27 的 54 条隐藏新功能与新特性。
MacStories 主编 Federico Viticci 发布博文,汇总 iOS / iPadOS 27 的 54 条隐藏新功能与新特性。
文章讲解大模型推理的 prefill 与 decode 两个阶段:prefill 并行处理给定输入,决定 TTFT;decode 逐 token 自回归生成,常受内存带宽限制。
作者用GPT-6 Astra、群核科技的Aholo Lux3D和Blender完整规划了一个包豪斯风格拍摄间。
文章区分 Agent harness、Agent framework 与 MCP 三层架构,指出 harness 拥有执行循环、状态、权限和恢复,框架只暴露钩子,MCP 仅拥有工具传输且无法在协议层强制同意。
作者在拆箱 Xteink X3 电子墨水阅读器后几小时内,借助 GPT-6 Astra(Codex)和 Fable 5.1(Claude Code)排查 CrossPoint 固件下灰度图片上的竖向条纹。
作者分享把 35kb 预提示从 OpenAI/Anthropic 迁移到自托管 Ollama 的实验笔记,在 65k token 上下文窗口下大提示词会迅速饱和并导致 Agent 重复工具调用。他提出单目标提示拆分、声明式定义 opencode agents、显式调大 ollama 上下文、会话状态落盘等做法,并列出上下文耗尽的失败信号如连续相同工具调用与重复读文件。
Anthropic 与 Accenture 联合发布帮助 CIO 和技术负责人把 AI 项目从试点推进到生产的实用蓝图。指南引用 Accenture 2026 年 7 月报告称仅 23% 的高管认为 AI 项目取得持续的企业级影响,并列出按时间顺序的七项考量、四部分任务定义、轻量总拥有成本模型、四层监督模型及决策过渡蓝图。
Michael Lynch 根据自己在 Google、Microsoft 及创业公司写设计文档的经验,讲解如何编写有效的软件设计文档,并附上一份完整的示例文档。
火山引擎采访AI导演DiDi_OK,介绍其完全用Seedance 2.5 720P制作的9分钟科幻短片《Candy》背后的制作过程。他称模型在精细定制化、运动规律理解和超长镜头一次生成上有突破,部分效果连续性超过传统CG;其工作流随之改变,提示词取代关键帧成为决定视觉上限的首要条件,世界观类叙事中分镜不再是必需。
OpenRouter 发布教程,讲解如何用独立的裁判模型按自定评分标准自动给 AI 智能体输出打分,覆盖确定性测试无法检查的开放式回答质量。
推荐理由:原文给出 LLM-as-a-judge 的适用边界、偏差来源和用 Ori Eval 落地的可复用步骤,还包含用人工标注校准裁判模型的方法。
该教程用 JAX、Flax、Optax 和 jax3d 的体渲染原语构建端到端分层 NeRF,包含位置编码、粗细双网络与 sample_piecewise_constant_pdf 重要性采样,并用 Adam、指数学习率衰减和梯度裁剪训练。评估涵盖 held-out PSNR、深度与透明度可视化、360 度渲染 GIF 以及 marching cubes 提取密度场等值面。
文章解析 Agent harness 层应对长任务中上下文溢出与目标丢失的四类机制:上下文预算与卸载、压缩、todo-state 复述和跨会话记忆。
推荐理由:文章把解决长任务中上下文溢出与目标丢失的机制拆成四类,并对照多款主流 Agent 产品的具体实现和阈值,便于读者迁移到自己的系统。
MarkTechPost 发布一篇教程,用 NVIDIA cuML 和 RAPIDS 构建覆盖 GPU 加速机器学习全流程的可运行工作流。
Simon Willison 用 GPT-6 Astra 和 ChatGPT Work 从家出发生成 5K 和 10K 环形跑步路线,运行 27 分钟,基于 Nominatim 定位地址、Overpass 下载 OpenStreetMap 道路数据,产出嵌入式地图可视化和可下载的 GPX 与 GeoJSON 文件。
vLLM 团队详解 Kimi K3 从 v0.27.1 到 0913 main 的服务性能优化,在 8K/1K、TP8、B300 节点测试下延迟降低 56%–60%,吞吐提升 2.2–2.8 倍,TTFT 降低 72%–85%。
OpenAI 的 Eric Provencher 撰文建议,切换到 GPT-6 Astra 时应精简技能描述、AGENTS.md 规则和任务提示词,因为过长的指令会占用上下文或导致模型过早停止。
作者曾是逆向 ANE Linux 驱动的开发者,三年后重新逆向 M1 上的 Apple Neural Engine,完整测绘其 16 计算核、2048 条 MAC 通道、任务描述符调度和内存层级。
OpenAI 发文介绍其在线存储平台 Habitat 从 Python 迁移至 Rust 的过程,该平台每秒处理超 7000 万次请求、每周服务超 10 亿用户、管理数据超 500PB。
Google 的 Gleb Otochkin 在 AlloyDB Omni 上实测嵌入向量版本更新对 PostgreSQL 存储的影响:在含 768 维向量和 HNSW 索引的 20k 行表上更新全部向量后,表、TOAST 和索引体积几乎翻倍(TOAST 从 81 MB 到 159 MB,HNSW 索引从 78 MB 到 156 MB),约一半空间被死元组占据。
Simon Willison 转述 Mohamed Moustafa 对 OpenRouter 自动路由的问题分析。不同供应商的推理软件、优化设置不同,同一端点可能行为不一致,部分供应商的视觉模型缺少视觉能力,reasoning effort 参数的处理方式也有差异。可用 provider.only 指定供应商,并通过 /endpoints 方法查询某模型可用供应商列表。
GitHub 日韩地区营销负责人 Tomoko Tanaka 分享如何不写代码,把活动运营交给 GitHub Copilot 自动化。
推荐理由:作者以自身营销工作为例,展示了用 Issue、Actions 和 SKILL.md 复用开发者治理流程落地自动化的完整路径。
OpenAI 发文(系列上篇)讲述其在线存储平台 Habitat 的演进:现每秒处理超 7000 万请求、服务每周超 10 亿用户、管理超 500PB 数据,覆盖近 40 个地区。
推荐理由:原文披露了 Habitat 从 Python 库到 Rust 服务的完整演进细节,含 asyncio 调优、连接池等可迁移经验。
Google 发布 autofinetune 项目,把 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和 GRPO),使用 Tunix、Gemma、Cloud TPU,由 Antigravity CLI 和 Gemini Flash 3.7 编排。
OpenRouter 通过 OpenAI 兼容的 POST /api/v1/audio/speech 端点提供文本转语音服务,一个 API key 可调用多家供应商的 TTS 模型。
作者实测 DeepSeek V4.1 Flash,缓存命中输入降价 7 倍多、输出砍三分之二,9 月 14 日中午 12 点起所有发往 v4-pro 的请求将被强制路由到 4.1 Flash 并按其低价计费。
推荐理由:作者实测 DeepSeek V4.1 Flash 的价格、架构参数和多个生成任务,并给出与 GLM 5.3 Flash 的对比结果和暴露的缺陷。
OpenRouter 发布 Presets 使用教程,preset 是一个命名且带版本的配置,统一存放模型或 fallback 列表、system prompt、provider 路由和采样参数,在任何请求中以 "model": "@preset/名称" 引用。
GitHub Copilot 应用新增 diff、终端、浏览器三个内置面板,让初学者在不离开应用的情况下完成 AI 智能体改动的审查、运行和预览。diff 面板以红绿高亮显示增删改行,用户可接受、评论或要求修改;终端面板可运行项目命令并支持多窗口,浏览器面板配合 Pick & Polish 工具选中界面元素让智能体调整,最后可直接在应用内接受变更并创建 pull request。
Google AI 的 Tilde A. Thurium 发布访谈视频,请 Annie Wang 从头讲解图工程(graph engineering),以及它如何让开发者掌控复杂 AI 系统。
Every 介绍了为什么要为每位员工构建个人基准(personal benchmarks),并说明如何开始按照自己的标准测试 AI 的表现。文章兼具动机阐述与可上手的实践指引。
LlamaIndex 博客提出 just-in-time Agentic OCR 模式:先用 LiteParse 等免费解析器粗读全部文件供检索,再仅对相关页面调用 VLM 做 OCR。
推荐理由:作者用 84 份 SEC 文件实测两遍式文档处理流程,给出明确的适用边界和成本数字,方法可直接迁移到自己的数据室场景。
推荐理由:原文给出完整的 12 步 3D 角色制作工作流和截图生成参考图的修正方法,Blender 初学者可以照着复用。
作者 Hugo Vergnes 用租用的 8× B200 在 43 小时内以 $998 训练了 3.8B 参数模型 little-lm,在 65.3B tokens 上达到 CORE 0.384,超过 GPT-2 1.5B 的 0.2565。