跳到正文

#开源生态

今日 2 条
9月1日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)62

    我用监控摄像头和 BirdNet-Go 搭建自动鸟类识别系统

    作者分享如何用 3 个现有监控摄像头的麦克风运行 BirdNet-Go,实现 24/7 本地鸟类声音识别,无需云服务和订阅费用。系统支持 RTSP 流、Google Perch v2 模型可识别 14,795 个物种、按物种设置 Discord 通知、新物种追踪、BirdWeather 数据共享,并可通过 MQTT 接入 Home Assistant,还能识别蝙蝠和青蛙。

  2. The Verge:AI(RSS)56

    Debian 投票允许开发者使用 AI 工具,但不会禁止 AI 代码

    Debian 投票通过新 AI 政策,允许开发者使用 AI 工具参与 Linux 发行版的开发、维护和文档工作,既不支持也不禁止生成式 AI 工具。政策强调“负责任”使用 AI 可提升生产力,但贡献者仍需对提交内容的质量、正确性和法律合规性负责,且不强制披露 AI 使用情况。部分贡献者对此不满,有人宣布退出 Debian。

  3. Microsoft Research 博客(RSS)72

    微软研究院发布高效病理基础模型 GigaPath-Flash 与 GigaTIME-Flash

    微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,旨在通过蒸馏技术大幅降低计算成本以支持大规模病理研究。GigaPath-Flash 将十亿参数模型压缩至 22M 参数,在保持竞争力的同时实现约 50 倍的算力节省;GigaTIME-Flash 则提升了空间蛋白质组学预测效率并改善了泛化能力。两款模型均以 Apache 2.0 协议开源,专为科研设计而非临床诊断,使研究人员能在单 GPU 上处理百万级切片数据。

8月31日周一
  1. IT之家(RSS)77

    DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

    DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。

    推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。

8月21日周五
  1. Microsoft Research36

    微软研究院发布 Skala 1.1,并推进其在 CP2K、Psi4 等 DFT 软件中的集成

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中拿下 32 项第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正在集成进 Psi4、FHI-aims、ORCA 和 VASP。微软研究院同时推出一个持续更新的基准,用于追踪后续 Skala 版本的计算性能。

8月6日周四
  1. Google DeepMind71

    Google DeepMind 发布 WeatherNext 气旋预报模型并开源

    Google DeepMind 在 Nature 发表论文,称 WeatherNext AI 模型在预测气旋路径、强度和风场结构上达到 SOTA,平均为预报员多争取一天预警时间,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出气旋预报多出一天预警时间的实测结果与开源入口,读者可据此判断气象 AI 的可用边界。

8月4日周二
  1. Microsoft Research71

    微软研究院开源 Orchard:可扩展智能体 AI 框架

    微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理三类智能体任务,并支持直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。

    推荐理由:微软研究院开源 Orchard 框架,公开环境服务、训练流程与数据,读者可据此了解小模型在真实 harness 中训练智能体的可行路径。

7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,把已有 CUDA 内核作为知识库迁移到 Apple Silicon。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,给出注意力与 Mamba 两个内核的具体加速数据。

6月9日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemma 4 12B:统一无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。该模型在标准基准上性能接近 26B MoE 模型,内存占用不到其一半,可在 16GB 显存或统一内存的设备上运行,并首次在中型模型中支持原生音频输入。

    推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此判断本地多模态智能体的硬件门槛。

4月27日周一