ZhangYvJing's

Daily Brief

← September 08, 2026 September 09, 2026 · Wednesday September 10, 2026 →
00

Film / Book Chapter

Paterson
2016 / Jim Jarmusch

Paterson (2016) · Jim Jarmusch

今天适合看《Paterson》,因为它更像一次生活和判断方式的校准,能把注意力从持续输入里稍微抽出来,重新放回你真正想怎样生活和做事上。

The Beginning of Infinity
David Deutsch

The Beginning of Infinity · David Deutsch

Chapter 1: The Reach of Explanations

A broader chapter for sharpening what counts as a good explanation, useful when daily inputs are full of claims, demos, and partial narratives.

01

Insight

今天的输入更像几股不同语气的材料同时挤在一起:社区链接在暴露工程和产品环境里的真实焦点,长视频在把这些焦点放回更完整的语境里,研究材料则提醒人热度和可落地性并不总是同一件事。如果先不急着做结论,至少可以把这几条线索放在一起看:Hacker News 的 Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs;Hacker News 的 Google DeepMind Releases AlphaGenome Atlas;Hacker News 的 On the Navier–Stokes Millennium Prize Problem;Hacker News 的 Mercury 2.5;Hacker News 的 Muse: Meta's personal AI agent, features and capabilities;Hacker News 的 DaVinci Resolve 21.1。真正值得注意的不是单条内容本身,而是它们共同指向了什么、彼此漏掉了什么。
03

Hacker News

01
Deltafin 在 Apple Silicon MacBook Pro 上通过四块 SSD 流式传输,实现了未经裁剪的 2.8 万亿参数 Kimi K3 模型局部运行,达到了约 1 token/s 的生成速度。该做法保留全部 16 路专家并由模型自身对每个 token 进行校验,避免任何质量损失来换取速度。通过将模型分块存储并在需要时调用,Deltafin 展示了在消费级硬件上推理超大规模模型的可行性,同时也凸显了存储带宽与缓存命中率成为性能瓶颈的矛盾。此进展意味着希望在个人工作站上进行前沿模型实验的开发者,可在不降低输出质量的前提下,以更低的硬件门槛获得可用的生成速度。
02
Google DeepMind Releases AlphaGenome Atlas
Google DeepMind 发布 AlphaGenome Atlas,预计算人类基因组全部 90 亿单碱基变异的调控影响并形成 1PB 数据集。该工具整合编码和非编码区预测,推出单一的 AVI 分数帮助研究者快速筛选优先变异。科研人员可通过免编程网站直接查询,从而在罕见病、复杂性状等研究中缩短数据检索时间,降低实验筛选成本。
03
On the Navier–Stokes Millennium Prize Problem
OpenAI内部系统解决了Navier–Stusto麦花奖问题,证明三维刚性 Navier–Stokes 方程组在有限时间内可发展奇点。系统通过约1万个代理协同推理,结合锐化后的模型产生解析证明,验证过程走过气uler方程的反例作为预热。奇点表现为流场中心区域收缩并加速旋转,能量保持有限但速度无界,揭示连续介质理论的边界。此举揭示了AI代理在复杂数学推理中的潜能,可能促使航空、气象和流体力学领域重新评估数值模拟的稳定性假设与计算资源分配。
04
Mercury 2.5
Mercury 2.5 于今日发布,作为迄今为止最强大的生产模型,采用扩散LLM架构,使用户器官化 workloads 提升40%性能,同时保持低延迟低成本的serving profile。该模型基于数千开发者反馈和上线后出现的生产故障案例,通过优化评估框架和聚焦训练流程实现,支持1,107 tokensPerSecond处理速度,上下文长度达26万token。针对搜索Agent、RAG管道、语音代理及代码子代理应用场景,OpenCall实测将响应延迟降至170毫秒,Augment Code的上下文压缩任务缩短至27秒,成本削减90%。当前API按量计费为每百万token输入0.04美元、输出0.15美元,后续将持续迭代更大规模的模型版本。
06
DaVinci Resolve 21.1
黑莓设计公司宣布DaVinci Resolve 21.1版本发布,网站页面显示该版本将于2026年正式版权登记。新版本继续保持现有的版权声明格式,包括版权所有、商标归属以及税费包含与否的细节说明。同时网站采纳了remarketing服务,通过第三方网站向之前访问过的用户进行广告投放,用户可随时通过更改cookie设置进行退出。该版本发布标志着软件在版权合规和营销策略上的延续性更新,可能影响使用者在版权遵循、税费计算以及隐私设置方面的操作流程。
07
Navier-Stokes – Tristan Buckmaster [pdf]
Hacker News 上分享了一份名为 "Navier-Stokes – Tristan Buckmaster" 的 PDF 文档。该文档使用 PDF 1.5 格式,包含线性化的对象结构,具备快速加载和部分渲染的能力。文件中包含多个对象定义,如目录树、页面描述和内容流,使用 FlateDecode 编码压缩处理。文档的结构涉及页面资源、内容描述和交叉引用表,显示出一定的技术细节和格式规范。 对于日常开发者而言,这种 PDF 文档的格式特性可能会影响不同平台上的文档解析性能。
08
Qwen3.8 27B 的 4 位量化模型已被压至 17GB,证实在 Terminal-Bench 2.1 等基准测试中可与完整 BF16 模型持平,而 1 位量化则跌至随机水平。作者针对 GPQA Diamond、IFBench 和编码基准分别测评,发现 4 位 Q4KM 性能稳健,2 位 UD-Q2KXL 仍可胜任大多数任务,唯有 1 位模型在推理过程中因噪声放大导致答案空洞或提前终止。这种非线性的量化衰减意味着开发者可在显存受限的消费级 GPU 上部署高质量模型,同时警惕极端压缩带来的推断失效风险,后果是本地部署成本下降但调试与验证阶段的容错率需显著提升。
09
GCC 将嵌套函数在中间端降低为对一个只包含被引用外层变量的合成结构体的隐藏指针参数,未被引用的变量不受影响。该结构体可像普通对象一样参加通用优化,使编译器可把嵌套函数当作普通静态函数处理,简化后端。这也为 WG14 讨论的静态局部函数提案 N3884 提供了可行实现路径。
04

YouTube

04
A single token of KV cache on Mistral 7B costs 131 KB. Multiply that by 16,000 tokens of context and 80 concurrent users and the cache alone wants 42 GB of GPU memory, which is why requests start failing on a 24 GB card. Harshul Jain, a senior software engineer at Audible, and Tanmay Sah, an independent AI researcher, spend this workshop building that number up from first principles. They open on three symptoms every team hits: memory that climbs with context length, time to first token that degrades as prompts grow, and throughput that collapses because a naive server answers requests one aft
agent, ai_frontier, ai_product, engineering
07
Rachit Kataria and Will Wang are the co-founders of Centralize (W24), an AI-powered platform that automatically builds org charts of enterprise accounts to help revenue teams map stakeholders, spot gaps, and close complex deals faster. The company recently closed a $15 million Series A led by NEA. In this Fireide, Rachit and Will sat down with Diana Hu, Managing Partner at YC, to talk about how Centralize's "trust graph" ingests emails, calls, and CRM data to surface human dynamics inside a prospect's org — and how one customer compressed a six-month sales cycle into weeks to close an eight-f
ai_product, market, product, startup
06

Bilibili

07

Papers

01
CUA-Universe 通过 App‑Forge 将真实桌面软件打包成可复现的 VM 并自动暴露命令行界面,Task‑Weave 基于种子文件合成可控难度的混合 GUI+CLI 任务,Path‑Steer 引导轨迹并收集验证数据。在该数据上训练的 9B 模型在 CUA‑Verse、OSWorld 等基准上成功率提升并步数、token 大幅下降,表明可扩展混合环境能有效提升代理的协同效率。
03
该研究质疑LLM在分子属性基准的高分是否仅来自记忆,通过审计22个前沿模型在12个回归基准上的逐字复现情况,并对比不同推理强度下的检测频率。结果显示多数基准出现广泛的逐字检索,而抑制检索后各模型误差趋于一致,说明真实预测能力不仅由记忆量决定。对依赖检索或微调的Agent系统评估具有参考意义。
06
公共机构需要在本地运行的开源LLM能够连续调用多个政府API工具,但现有模型在多步工具链任务上表现不佳且缺乏衡量标准。本文提出KOPA‑Bench(145个真实任务)以及EDGE——基于真实API执行验证的动态图,用来筛选可行的工具调用链并合成多步轨迹。以此数据用GRPO微调9B模型,使其性能接近同家族未调参的27B模型,在KOPA‑Bench和BFCL上均显著提升。提供了可落地的基准与数据合成方案,有助于构建可靠的多步政府API Agent。
08
现有学习动画器依赖特定骨骼模板或每骨骼微调,难以直接为任意骨骼生成动作。UniMate 采用拓扑感知的扩散Transformer,通过图偏置、谱旋转位置编码和全局顶点条件器统一处理任意骨骼,无需测试时优化。在UniML3D数据集上实现零跨拓扑迁移、文本驱动编辑等,为Agent生产提供通用骨骼动画方案,值得关注。