在 M4 Pro Mac mini 上搭建本地 LLM 环境的完整方案
作者分享在 48GB 内存 M4 Pro Mac mini 上运行本地 LLM 的完整方案,主模型为 Qwen3.6-35B-A3B-OptiQ-4bit(约占用 20GB 内存),轻量模型为 Gemma-4-E4B,推理服务用 oMLX,通过 Tailscale 让 iPhone、MacBook 共用同一后端,并接入 Hermes、Pi、Apollo 和 Raycast。
作者分享在 48GB 内存 M4 Pro Mac mini 上运行本地 LLM 的完整方案,主模型为 Qwen3.6-35B-A3B-OptiQ-4bit(约占用 20GB 内存),轻量模型为 Gemma-4-E4B,推理服务用 oMLX,通过 Tailscale 让 iPhone、MacBook 共用同一后端,并接入 Hermes、Pi、Apollo 和 Raycast。
推荐理由:官方宣布 LongCat-2.0 可在 Cline 免费试用,并给出安装命令和模型选择路径,读者可直接接入现有编码工作流。
UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。
推荐理由:作者实测新版本并给出使用路径,读者可据此评估手机端远程跑 Coding Agent 的可行性。
澳大利亚律所 Gilbert + Tobin 通过 ChatGPT Enterprise 和 Codex 将 AI 融入运营,截至 2026 年 6 月 87% 的启用席位处于活跃使用状态,是其其他工具采用率的两倍以上。
Simon Willison 在为地方政治边界收集地图时,请 GPT-5.6-Sol 建议工具,模型主动构建了一个 GeoJSON 地图查看器,可显示 GeoJSON 并导出 PNG,随后经 Claude Code for web 和 Fable 5.1 迭代完成。
Modal 官方博客介绍时尚电商公司 Botika 如何利用 Modal 平台运行其全栈生成式 AI 业务。Botika 在 Modal 上处理 100TB 图像数据管道、训练数十亿参数的专有基础模型,并服务约 15 个生产推理模型。CEO Eran Dagan 表示,Modal 帮助团队将实验吞吐量从每人每天 1-2 次提升至 50 次,并简化了多节点训练和强化学习基础设施的搭建,替代了传统的 Kubernetes 或云厂商方案。
作者发布 slotstream,一个 Swift 单二进制工具,把 104GB(4-bit、125B 参数 MoE)的 Qwen3.8-Flash-Next 从 SSD 流式加载到内存不足以容纳的 Mac 上运行。
Databricks 工程团队分享如何在一小时内消除每年 100 万美元的 AI 智能体浪费支出。工程师团队高度依赖 AI 智能体来简化和加速工作,由此产生了相应的使用开销。
Satya Nadella 表示 Microsoft 最新威斯康星 AI 数据中心 Fairwater 每年用水量约等于一家本地餐厅,冷却回路一次性注水后可近乎零耗水运行。
Claude 官方频道发布视频,主题为与客户一起构建企业级前沿安全防护(Enterprise Frontier Safeguards)。原文无正文文本,仅提供标题和视频链接 https://www.youtube.com/watch?v=FoteuzPpx7E 。
Anthropic 发布 Enterprise Frontier Safeguards(EFS),将零数据留存的隐私与检测滥用的安全监控结合,数据存储在客户控制的云基础设施而非 Anthropic 侧。
Empirik 宣布从 Sequoia 孵化后独立,获得 2100 万美元种子轮融资,投资方包括 Sequoia、Canapi 和 Alumni Ventures。
马斯克 9 月 1 日在 G20 会议上演讲称,预计 AI 将使全球经济规模增加约 20%-30%,即每年增加约 20 万亿至 30 万亿美元。他预计到 2027 年底 AI 将能完成所有数字领域的工作,AI 编程能力明年可能达到"Stockfish 级";未来 10 年全球人形机器人数量将超 10 亿台,每台生产力至少相当于人类 5 倍,有望使全球经济规模扩大 10 倍以上。
ByteByteGo 发布长文,讲解如何在大语言模型不明显变笨的前提下缩小模型体积。文章以 70B 参数模型约 140 GB、消费级显卡仅 24-48 GB 显存的矛盾为切入点。
高通于 9 月 1 日发布跃龙(Dragonwing)Q-2390 和 IQ-2390 处理器,面向消费级物联网、工业边缘计算等领域。
Hugging Face WebAI 团队发布 @huggingface/kernels 库及 207 个以独立仓库形式托管在 Hub 上的 WebGPU 内核(Apache-2.0),每个内核带 manifest、正确性测试、基准用例和 WGSL 着色器模板。
推荐理由:原文给出与 ORT WebGPU 的对比数据和开源加载方式,读者可据此评估浏览器本地推理的可行路径。
Discovery Bank 通过行为 AI、治理化数据和实时决策,在满足规模、速度与安全要求的同时让每个客户交互都具备个性化体验。文章介绍了该银行实现大规模超个性化银行服务的具体方法。
群创光电(InnoLux)发布 Chip Last 型 FOPLP(扇出型面板级封装)技术平台,预计 2027 年下半年量产,切入 AI/HPC 次世代先进封装供应链。
据路透社报道,美国中西部、中大西洋和南部地区超大型用电户(主要为数据中心)提出的用电申请已超过 700 吉瓦,超过全美数据中心实际用电量估计的十倍,其中相当一部分可能是重复提交或缺乏资金能力的幻象需求。
推荐理由:路透社调查给出超 700 吉瓦用电申请与各州整治措施的具体数字,读者可以据此了解 AI 数据中心电力泡沫的真实规模。
蚂蚁 inclusionAI 在 Hugging Face 发布 Ling-3.0-flash-singprobe,一个基于 Ling-3.0-flash 的流式安全护栏探针,复用基座模型隐藏状态在每个 token 上输出意图、不安全性和幻觉风险共 10 类评分,探针参数仅 5.18M,解码开销低于 0.5%。