01
ZhangYvJing's
Daily Brief
00
Film / Book Chapter
Still Walking
Still Walking (2008) · Hirokazu Kore-eda
今天适合看《Still Walking》,因为它更像一次生活和判断方式的校准,能把注意力从持续输入里稍微抽出来,重新放回你真正想怎样生活和做事上。
Show Your Work!
Show Your Work! · Austin Kleon
Chapter 2: Think Process, Not Product
A light but useful chapter for making ongoing work visible without waiting for perfect finished artifacts, which fits a public career surface.
01
Insight
今天的输入更像几股不同语气的材料同时挤在一起:社区链接在暴露工程和产品环境里的真实焦点,长视频在把这些焦点放回更完整的语境里,研究材料则提醒人热度和可落地性并不总是同一件事。如果先不急着做结论,至少可以把这几条线索放在一起看:Hacker News 的 Watching Go's new garbage collector move through the heap;Hacker News 的 Decathlon Germany adds Wero payment option to decathlon.de website;Hacker News 的 Kimi-K3 on HuggingFace;Hacker News 的 Glue bonds to nonstick surfaces and wipes clean with ethanol;Hacker News 的 Self-contained highly-portable Python distributions;Hacker News 的 MAI-Cyber-1-Flash inside MDASH。真正值得注意的不是单条内容本身,而是它们共同指向了什么、彼此漏掉了什么。
03
Hacker News
02
03
Kimi K3 首发开源权重,拥有 2.8 万亿参数、1 亿 token 上下文窗口,支持文本、图像与视频同框推理。其核心是 Kimi Delta Attention 与 Attention Residuals 结合的 Stable LatentMoE 框架,每次仅激活 896 个专家中的 16 个,提升 2.5 倍的稀疏扩展效率。模型面向长期编码、知识工作与工具协同,能在单一
04
05
06
MAI‑Cyber‑1‑Flash 與 MDASH 集成,二者合力在 CyberGym 上達 96% 分數,成本比現有頂尖模型低 50%。AI 進步與日益強大的攻擊令傳統“間歇掃描”模式失效,輕量模型覆蓋 90% 任務,僅用高成本模型處理 10% 最難問題,從而降低檢測成本並提升實時修復效率,直接改變安全運維人員的工作方式與預算。
07
08
09
10
04
YouTube
01
Data Quality Research at Prime Intellect and State of Data Author. Prior investor at Hummingbird and Costanoa. Speaker: Sean Cai — CEO, Independent / State of Data X: https://x.com/SeanZCai Website: https://www.seancai.com/
02
Full episode: https://www.youtube.com/watch?v=OS1NZLgKM2c Me on twitter: https://x.com/dwarkesh_sp
03
DeepSWE is 113 software engineering tasks written from scratch, not scraped from pull requests, so a model cannot have seen them in training. Each one is a long horizon problem drawn from a real open source repository, authored by engineers who actually maintain that code, with isolated environments and program based verifiers that check observable behavior rather than trusting the model's own account. James Shi's point is that once you remove the contamination the leaderboard stops clustering: strong models pull far ahead and others, Gemini 3.1 Pro among them, fall toward the bottom. The mor
04
Full episode: https://www.youtube.com/watch?v=QbdbAhaJoCQ Me on twitter: https://x.com/dwarkesh_sp
07
Papers
01
这篇论文解决的是量子化学计算中“构建低深度基态准备电路”这一瓶颈。作者先用现有的迭代方法 ADAPT‑VQE 生成高质量参考电路,再把这些电路当成标签训练一个 Transformer 生成模型 ADAPT‑GQE。训练好的模型能快速提出并评分新电路,随后用强化学习进一步优化,最终在分子 imipramine 上实现比 ADAPT‑VQE 快数十倍、准确度相当或更优的基态准备。对于像张玉璟的 Agent/AI 工程师而言,这展示了将生成式大模型与量子电路设计结合的“闭环自动化”方案,可显著压缩量子化学模拟的电路构造时间,意味着更高效的药物设计与材料模拟工作流。
02
核心问题:LLM生成代码往往只靠人工编写的测试用例,若Wt自然语言需求且自动生成的测试本身质量不佳,LLM的随机性会导致错误测试误导优化,混合 сут的测试会产生矛盾评估,代码选型不可靠。解决办法:MineValiCoder构建闭环 TDD 框架,TCQM 模块通过自检剔除错误测试,Parallel TDD Refinement 迭代优化代码同时生成多样化高质量候选,BiCoTeV 模块利用双向图建模代码-测试交互,进行互检评分,从而稳定挑选最优代码。为什么值得关注:该方案突破了“仅有自然语言需求⇒无质量测试”的瓶颈,让 LLM 在缺乏人工指导时也能稳健生成代码,直接解决 Agent/AI 产品在快速迭代、自动化部署时遇到的代码可靠性难题。
03
LoRA在大模型上全部矩阵均匀更新,导致算力和内存开销爆炸。本文提出κ-LoRA,先用条件数挑出“最活跃”的低秩矩阵,只更新前50%,从而把可训练参数减半、计算和显存分别下降约16%与4.5%。对资源受限的边缘或在设备微调场景,这种基于谱重平衡的精准更新方式既省时又能保持 Bikespace 准度,工程师值得快速了解。
04
05
Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science
本研究揭示商业 LLM 在判断伪科学时的可信度并非模型固有特性,而是部署配置(系统提示、安全层、接口路由、隐式更新)决定的。作者对 Claude、Grok、GPT、Gemini 四大族群在 API 与 web 端、2025‑26 年不同时间点的同一伪科学判定进行对比,发现同一模型在不同接口与时间点可从 70‑75 直冲到 5‑8 并出现“拒绝评分”现象,甚至在无文档更新的“silent patch”后突变。对工程师而言,这警示在设计 Agent 或产品时,必须把握与监控配置层对模型行为的潜在影响,以sport可靠的知识引用与用户信任。
06
07
本文在高风险领域—空中交通管理—中探究让强化学习智能体的决策可解释,以提升人机协作与信任。通过在简化ერს ATC 环境训练 RL 代理,让其在避开禁区时选择替代航路,并利用重要性热力图(saliency map)显示哪些状态特征runs決策主导,展示了可视化解释机制。对于代理/AI 产品工程的你,这研究展示了在安全关键任务中嵌入可解释性的可行性,为实现自动化与人工互补提供了实验框架与可复制的技术路径。
08
08
Issue Monitor
Ready now—Actionable issues
Needs review—Awaiting a fresh check
Data statusCheck statusLive status unavailable



