ZhangYvJing's

Daily Brief

← August 16, 2026 August 17, 2026 · Monday August 18, 2026 →
00

Film / Book Chapter

Perfect Days
2023 / Wim Wenders

Perfect Days (2023) · Wim Wenders

今天适合看《Perfect Days》,因为它更像一次生活和判断方式的校准,能把注意力从持续输入里稍微抽出来,重新放回你真正想怎样生活和做事上。

The Effective Engineer
Edmond Lau

The Effective Engineer · Edmond Lau

Chapter 1: Focus on High-Leverage Activities

A direct chapter for choosing what to work on today: it keeps attention on compounding engineering output rather than just being busy.

01

Insight

今天的输入更像几股不同语气的材料同时挤在一起:社区链接在暴露工程和产品环境里的真实焦点,长视频在把这些焦点放回更完整的语境里,研究材料则提醒人热度和可落地性并不总是同一件事。如果先不急着做结论,至少可以把这几条线索放在一起看:Hacker News 的 Claude: System Prompts;Hacker News 的 A 3rd World Embedded Engineer Responds to "RISC-V They Should Have Known Better";Hacker News 的 The AI Credit Resale Economy;Hacker News 的 St Lucie Nuclear Reactor Unit 1 manually shutdown, 3 control rods drop into core;Hacker News 的 NIH is ending a key grant for budding clinical researchers;Hacker News 的 Anton Chekhov played at love most of his life。真正值得注意的不是单条内容本身,而是它们共同指向了什么、彼此漏掉了什么。
03

Hacker News

01
Claude: System Prompts
Claude 在网页和移动端通过系统提示在每次对话开始时注入当前日期等实时信息,并强制返回 Markdown 代码块。此提示会定期更新以提升回答质量,但仅影响网页/移动端,API 版本保持不变。自 Claude 4.6 版起,每个模型 ID 变为单一快照,后续更新不再产生多版本差异。
02
RISC‑V 继续被推向低成本 MCU 市场,作者指出其在“RV32EC”芯片上的实现已成为十美分级别的微控制器核心。文章解释了低成本 MCU 需要极小的面积、低延迟中断、良好的代码密度以及缺乏除法器和乘法器等硬件运算单元,而 RISC‑V 的指令集正好满足这些需求。由于这些芯片在全球范围内可直接采购,尤其是对远离美国和欧洲的地区,开发者和教育工作者可以以更低的成本获得完整的硬件平台,从而降低采购与物流成本,提升教学与原型开发的可行性。
03
The AI Credit Resale Economy
在人工智能推理市场出现了一种新现象:中介机构购买初创企业未使用的推理额度后再转售。 这一模式源于创始人频繁收到购买请求,代理商不直接提供密钥,而是从池中挑选并转发;平台声称大宗采购可提供高达40%折扣,吸引交易。 这种交易方式让企业面临更高的成本波动、潜在滥用风险,并促使监管部门加大对信用转售的审查力度。
06
Anton Chekhov played at love most of his life
契诃夫的私人生活被重新解读,显示其并非传统意义上的性禁欲者。新公开的信件显示他与克尼普的书信往来,既有情感戏谑又保持专业敬意,说明其在医学与文学间保持平衡。此发现将影响文学教学与研究方法,促使学者在分析契诃夫作品时更加关注其真实人性与社会背景,调整课程与批评框架。
07
GPS and the Lost Art of Getting Lost
以色列军方利用干扰与伪造 GPS 信号,导致司机在使用 Waze 时被误导驶向错误方向。该做法使得 GPS 设备接收到虚假位置信息,导致自动安全系统被迫关闭,航运与航空领域的操作员不得不手动干预。依赖 GPS 的司机、船员、科研人员以及日常使用地图导航的公众,将面临更高的误导风险、成本增加以及对传统的认知地图能力的削弱。
09
Firefox for iOS now has a native adblocker
Firefox for iOS 现在内置原生广告拦截功能,当网页依赖 JavaScript 时,若浏览器设置或插件阻止脚本,站点可能提示所需资源未加载。这也说明,广告拦截器或网络问题等因素会导致页面无法正常载出,用户可能需要检查连接、关闭拦截或更换浏览器才能恢复访问。
10
一段关于1963年塑料机械计算机Digi-Comp 1的视频出现在YouTube页面,页面标题直接指出这是一段视频。材料仅提供了视频的标题和页面常见的关于、版权、开发者等链接,未给出视频产生的具体原因或背景机制。由于没有进一步说明,目前无法确定该视频对哪些人的工作方式、成本、风险或规则会产生何种影响。
04

YouTube

05
Exo is a systems approach to recursive self improvement. In short, it's a complete AI agent harness (supporting tools, tasks, integrations, etc. similar to OpenClaw, Pi or Hermes), with the crucial difference that it has full visibility into both its code and runtime logs. This allows Exo to incrementally improve every aspect of itself, clone itself, and even manage a lineage of clones. While most agents can do some form of self improvement, such as updating memory or creating skills, Exo is fully recursive in that it can clone or operate on any aspect of itself, from prompts, to memory, tool
agent, ai_frontier, ai_product, engineering, market, startup
07

Papers

01
大型语言模型往往依赖非许可数据,给开放源代码研究者带来高门槛。Mimir v1采用1B参数的Hierarchical Reasoning Model架构,完全用161个可许可后训练数据集训练,英德双语表现竞争力,并在丹麦语刷新SOTA。对张玉璟的Agent/AI产品工程而言,它提供无版权障碍的高性能基础模型,便于快速集成与定制。
02
AI 代码生成缺乏正确性保证,现有基准只检验单函数或已有实现的证明,无法评估跨模块完整实现与证明。 Vero 用 43 个真实多模块 Lean4 仓库、API、手工规范、参考实现,并加入审计机制,让代理同时生成代码和机器检验的证明,直观揭示现有技术瓶颈,助力可信软件研发。
03
DARTree 解决了自回归语言模型在推理时的速度与准确性冲突。它把 diffusion‑based draft tokens 组织成固定宽度的树,利用 AR correction head 在树上做一次性评分,再用 best‑first pruning 选出验证路径,完全不需要额外训练。实验显示,在 math、code、chat 等七大基准上,DARTree 的接受长度和速度提升均超过 DFlash 与 Domino,单轮可验证 12.97 个 token,整体 lossless 加速高达 9.73×。对 Agent/AI 产品工程师而言,这意味着更快的推理、更低的延迟,且无需额外训练成本。
04
现代 LLM 训练数据杂乱无章,难以追踪知识来源。作者构建了 88B‑token 的 LITTLECURRICULUM,只包含美国小学 5 年级以下内容,并用它训练出 5B 参数的 LITTLELEARNER。该模型在保持语言能力的同时,知识与能力被映射到可解释的课程边界,可作为受控沙盒来研究模型如何在限定范围内学习、表示和使用知识,并通过后训练和上下文学习注入新知识而不扩展超出范围的能力。对想要构建可解释、可调控 Agent 的工程师来说,这套工具能让你在安全、可预测的环境里快速验证知识注入与推理策略。
05
LLM 代码代理在 Bash 命令交互中,匹配的执行分数往往掩盖了生成后出现的错误。作者构建 QuoteBench,利用 56 个一-shot 任务和一个故意未转义的解析器,精确验证最终状态,量化生成与执行边界的失效。对 Agent/AI 产品工程师而言,这提醒评估时不能仅看匹配分数,而要报告模型配置、生成契约、执行路径和最终状态校验,避免误判并优化部署。
06
人形运动跟踪评估往往只看关节误差,忽略脚滑、落地时机等人眼最关心的接触与稳定问题,且现有测试集规模小、缺乏多样性。本文提出 HumanTracker benchmark,收集约153小时专业表演者光学轨迹,按四类动作并配细粒度文本标签;同时训练 HumanScore,基于12K对比样本的偏好学习,能更准确预测人类喜好并揭示传统关节误差难以发现的接触与稳定失误。对 Agent/AI 产品工程师而言,它提供了更贴近真实感知的评测工具和指标,能帮助快速定位和改进机器人/仿真系统的运动质量。
07
现有 AI 科学家只用文本、代码等有限证据,忽略空间、时间、跨通道关系。OmniScientist 通过感知层和三大自治代理(ideation、experiment、writeup)在确定性流水线中直接处理图像、信号、音频、视频、3D 结构等多模态原始数据,自动生成假设、实验方案并写稿,同时在代码层做新颖性、统计有效性、可追溯性检查。实验表明,生命周期全感知显著提升 7 维评估,胜率 85%,为构建全能 AI 科学家提供可落地路径,值得 Agent/AI 产品工程师关注。
08
AutoDesign 解决多模态内容转化为结构化输出时,传统静态模型无法自我迭代的问题。它通过 meta‑harness optimizer 指导 code agent 在每一次 rollout 反馈后递归改进 harness,形成真正的长周期 agentic 设计循环。实验显示,在学术论文到海报的任务上,AutoDesign 超越 Claude Design,成本低、效率高,且人类评测偏好最高,值得 Agent/AI 工程师关注。