Aleph Alpha 研究:中国模型在敏感话题上复述官方立场或拒答
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
Aleph Alpha 用自建基准测试了阿里千问、DeepSeek 和月之暗面 Kimi 的模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统认为仅 17% 至 41% 的回答算平衡,其余复述官方立场、回避或拒答。
KernelZero 提出协同进化框架,用 Proposer 从 API 集合生成 Torch 模块、Coder 将其翻译为 CUDA 或 Triton kernel,并引入 CA-GRPO 在正确性可靠后再优化性能。
DeepSeek-AI 发布技术报告,介绍用于大规模 LLM 智能体 RL 训练与评估的生产级沙箱平台 DeepSeek Elastic Compute(DSec),统一提供 FnCall、容器、microVM 和完整 VM 四种后端。
针对 DeepSeekMoE、OLMoE 和 Qwen3-MoE 的研究发现,MoE 模型合并后大部分专家重分配源于输入偏移而非同层参数变化,源路由差异难以预测恢复源路由带来的下一 token 似然增益。
DeepSeek 发布 DSec(DeepSeek Elastic Compute)论文并署名梁文锋,公开用于 Agent 训练的沙盒基础设施技术细节。
推荐理由:原文给出开源模型成本与成绩的完整对比,读者可以据此评估 DeepSeek-V4.1-Flash 在性价比上的位置。
论文提出神经网络向量表示隐式实现了 Tensor Product Representation 符号结构,作者用 DISCOVER 方法将多种网络(含 Gemma-3-27b、GPT-2-XL、GPT-OSS-20b、Pythia-12b、Qwen3-14b、OLMo-2-13B、Llama-3.1-8b 共 7 个 LLM)的表示替换为符号化闭式方程,模型行为基本不变。