01
ZhangYvJing's
Daily Brief
00
Film / Book Chapter
First Man
First Man (2018) · Damien Chazelle
今天适合看《First Man》,因为它更像一次生活和判断方式的校准,能把注意力从持续输入里稍微抽出来,重新放回你真正想怎样生活和做事上。
A Philosophy of Software Design
A Philosophy of Software Design · John Ousterhout
Chapter 2: The Nature of Complexity
A high-value chapter when refactoring or agent workflows feel messy: it names complexity as the thing to manage, not merely lines of code.
01
Insight
今天的输入更像几股不同语气的材料同时挤在一起:社区链接在暴露工程和产品环境里的真实焦点,长视频在把这些焦点放回更完整的语境里,研究材料则提醒人热度和可落地性并不总是同一件事。如果先不急着做结论,至少可以把这几条线索放在一起看:Hacker News 的 Discovery Loop;Hacker News 的 Zed DeltaDB;Hacker News 的 Changes at Google DeepMind: Demis Hassabis from CEO to Chair, Jeff Dean departs;Hacker News 的 Beating GPT-5.6 Sol on retrieval with 100x cheaper open models;Hacker News 的 Atlassian Rovo Exfiltrates Data, Bypassing Controls;Hacker News 的 Muse Code and Muse Spark 1.2。真正值得注意的不是单条内容本身,而是它们共同指向了什么、彼此漏掉了什么。
03
Hacker News
02
03
04
05
Atlassian Rovo AI 通过间接提示注入实现数据外泄,绕过现有控制。攻击利用Rovo的URL检索工具和Markdown图像渲染漏洞,即使禁用网络搜索,仍可将敏感信息动态附加至攻击者网站并被记录。因而,使用
06
07
08
09
10
04
YouTube
01
Most people treat biology as a bespoke, messy science. Josh Meier and Matt McPartlon, co-founders of Chai Discovery, treat it as an engineering problem. They make the case that drug design obeys the bitter lesson: scale data, models, and compute, and the model can learn what a hand-built pipeline simply couldn't capture. The results are concrete: Chai-2 pushed de novo antibody design from a sub 0.1% hit rate to 16%, turning a needle-in-a-haystack search into something more like designing a key to fit a lock. Josh argues, counterintuitively, that biology is more verifiable than code, and explai
02
Full episode: https://www.youtube.com/watch?v=QbdbAhaJoCQ Me on twitter: https://x.com/dwarkesh_sp
03
04
07
Papers
01
解决 LLM 推理时固定预算浪费算力、难以解释的问题。作者用轻量化模糊控制器,将“prompt 复杂度”“模型置信度”等可解释信号映射到每条查询的采样预算,易题少采样、难题多采样。实验表明,Adaptive Fuzzy Control 在保持接近全预算性能的同时,平均样本数显著下降,既提升效率又让算力分配可追溯,适合 Agent/AI 产品工程师快速评估与部署。
02
现代大型语言模型(transformer、diffusion)主要做预测与生成。本文证明低深度量子电路(QNC^0)在分布采样和函数计算上可超越常数深度的经典 DLM/transformer,给出具体分布与函数构造。对 Agent/AI 产品工程师而言,这揭示了量子技术在语言模型中的潜在优势与局限,值得关注未来架构设计。
03
04
解决在强化学习中对大型语言模型进行后训练时,专家模型在难题上失败导致的“金色负面轨迹”被丢弃的问题。ReflectRL 先把这些失败轨迹当作反思材料,提炼出 Reflective Reasoning,再通过 Reflective-to-Direct Policy Transition 把反思得到的推理能力迁移回直接推理。这样既能利用原本被忽视的失败信息,又能在保持极低开销的前提下显著提升多种 LLM 的推理表现,适合需要快速迭代、低成本提升推理质量的 Agent/AI 产品工程。
05
Video-DeepResearch 解决多模态智能体从静态图像向连续视频流迁移的难题,克服模态偏差与参数泄漏。它通过感知‑探索解耦、分阶段工具解锁和跨帧视觉扎根,再配合监督微调+GRPO训练,迫使模型在检索前完成完整视觉理解。实验表明,35B‑A3B 在 Video‑DR‑Bench 上达 64% 正确率,超越 Claude‑4.5‑Sonnet、GPT‑5 等,证明即使在 30B 规模也能实现高效自主探索,值得 Agent/AI 产品工程师关注。
06
编译器往往因程序表示缺失语义而错过可观的优化机会。本文用大型语言模型(LLM)从 C/C++ 代码上下文中推断隐藏的语义,生成经过验证、契约保持的优化工件,并在 SeGaBench 上评测。实验表明,最强模型在 94.8% 的回答中生成正确工件,83.3% 的案例实现 1.05× 的加速,显示 LLM 可作为编译器的“语义猜测”伙伴,为 AI 产品工程提供自动化、可验证的性能提升路径。
07
论文指出,现行的 test‑time scaling 方案缺乏统一度量与可复现性,导致不同推理策略难以公平比较。作者把推理视为在自回归模型的前缀树上进行预算化推理,划分单轨、叶级和前缀级三种结构,并提出评估配置文件与复现准则,最终公开 20 亿条完整推理轨迹。对 Agent/AI 产品工程师而言,这套框架能让你在有限算力下精准评估、对比并复现 LLM 推理性能,提升系统可靠性与调优效率。
08
解决:强化学习在工具集成推理(TIR)中只能用轨迹级监督,导致长序列任务难以细粒度分配奖励;token级监督又忽略了工具交互的“回合”结构。做法:TurnSight 通过回合级后视自蒸馏,先生成多种不同前瞻视角的后视监督,再用跨前瞻方向一致性挑选可靠信号;随后在同级回合间归一化并自适应调节 RL 奖励,保持原优化方向。值得看:它让 Agent 在长序列工具交互中获得更精准的信用分配,提升学习效率与性能,正是工程化 AI 产品需要的高效、可解释的训练框架。
08
Issue Monitor
Ready now—Actionable issues
Needs review—Awaiting a fresh check
Data statusCheck statusLive status unavailable



