01
ZhangYvJing's
Daily Brief
00
Film / Book Chapter
Still Walking
Still Walking (2008) · Hirokazu Kore-eda
今天适合看《Still Walking》,因为它更像一次生活和判断方式的校准,能把注意力从持续输入里稍微抽出来,重新放回你真正想怎样生活和做事上。
A Philosophy of Software Design
A Philosophy of Software Design · John Ousterhout
Chapter 2: The Nature of Complexity
A high-value chapter when refactoring or agent workflows feel messy: it names complexity as the thing to manage, not merely lines of code.
01
Insight
苹果连续两天发布M6与M5 Ultra,首次尝试2纳米工艺和四die超融合架构,意味着AI工作负载不再依赖云端,开发者和专业用户能在本地跑更大模型、编代码、渲染视频。Hacker News同时提到OpenAI的Jalapeño芯片以每瓦特700+ token刷新记录击败Nvidia Blackwell,说明大模型推理正在从算力中心回归边缘,能源监管与芯片选型正同步发力。但YouTube的Khurram Javed与Rich Sutton指出,AI仍缺不可或缺的“感觉再学习”与真实世界物理反馈——他们用神经学案例讲了失去躯感后人需要多年重新行走的过程,这种从零重建的过程何止是算力问题,意味着AI代理在真实场景部署时仍面临时空延迟与不确定性。Parag Agrawal调侃agents会比人类访问网页千倍——但广告经济模式因此崩塌,Turbo产品实现200毫秒搜索,却暴露内容方为机器点击找不到收益的结构矛盾。arXiv推出EarthVerse与SWE Refactor Bench基准,检验agent在灾害响应与全仓库迁移中的端到端可靠性,25种模型中最高仅47/100通过全部测试,说明current agent在认知、记忆与跨域推理上的跳跃仍远不够。总体来看,硬件突破解锁了更快的算力,却未解决AI“跑得快不跑得准”的根问题:当神经网络把技能埋在权重里,而个体化信息塞进上下文,系统在陌生环境下重建能力仍依赖离线训练的惯性,今天的讨论越聚焦于算力与效率,反而稀释了对实际可交付能力的审慎衡量。 Still Walking (2008)。
03
Hacker News
02
03
科学家指出,黑洞奇点并不是一个点,而是一个二维的曲面。这是因为两个自由落入球形黑洞、沿不同轨道的观测者在奇点处不会相遇,早在远离奇点的地方就失去了因果联系,说明在广义相对论中空间临近并不保证因果相通。这意味着量子引力研究需把黑洞的量子态视为存于该奇点曲面上,与事件视界内霍金辐射的热大气保持unitary演化和热平衡,影响相关理论模型的构建和验证方式。
04
05
OpenAI刚于Hot Chips公布代号为“Jalapeño”的AI推理芯片,据称在单张芯片上实现了每瓦特超过700个token的吞吐量,甚至击败了英伟达的Blackwell架构。该芯片于2024年中期启动设计,仅用约16个月完成从组建团队到流片的全过程,采用Broadcom合作打造,支持HBM4内存,主打普适化推理而非专精某类模型。其性能优势来源于硬件与软件深度协同设计,目标客户为功耗受限的数据中心,注重以效率换取整体吞吐能力。此举意味着大模型服务提供商可望在相同能耗下提升响应速度和成本效益,而能源监管与数据中心电力建设方式也将影响未来芯片选型逻辑。
06
07
Nitter 项目收到停止和禁止通知,导致所有公开实例出现相同的速率限制错误。每个实例都返回完全相同的 “Instance has been rate limited.” 提示,说明该限制源于统一的停止和禁止指令。依赖 Nitter 前端的用户将面临服务不可用,可能需要额外时间切换到其他方案,从而增加使用成本和信息获取风险。
08
印度尼西亚苏拉威西海岸的渔民每年引爆超过八千枚水下炸弹,将珊瑚礁变成废墟。材料指出这是禁用的爆炸捕鱼,塑料瓶装炸药在九十英尺范围内致死,且爆炸声通过水体传播速度是空气的四倍多,使监测能够十英里外捕捉。这导致珊瑚幼体难以定植,使珊瑚恢复成本上升、监管风险增加,亟需实时声波探测网络来协助当局执法。
09
10
04
YouTube
01
Today's systems put skills in the weights and personalization in the context. Khurram Javed's counterargument comes from neurology: people who lose proprioception can't walk at all, then relearn it over two or three years using vision alone. Twenty years of bedrock, rewritten. That's the capability our models don't have.
02
Full episode: https://www.youtube.com/watch?v=-RXD4bTuFTo Me on twitter: https://x.com/dwarkesh_sp
03
Parag Agrawal is making a bet that goes against two decades of web search: agents will query the web a thousand times more than humans ever have, and the infrastructure built around human clicks is wrong for them. The former Twitter CEO, now founder and CEO of Parallel Web Systems, explains why Parallel treats human click data as a bug and trains on agent feedback instead. He unpacks the counterintuitive choice to ship a search agent before a search engine, building an index incrementally, and how the new Turbo product cut agentic search to 200 milliseconds. But the problem Parag keeps returni
04
Parag Agrawal (former CEO of Twitter, now founder of Parallel Web Systems) on the single bet the company was built on: agents will search and browse the web 1,000x more than humans ever have — which means reinventing both the technology and the business model underneath it. #ai #internet
05
Is synthetic data a general method that scales with computation? Rich Sutton's answer is immediate. The reasoning is the Big World Hypothesis, which Khurram Javed wrote up as a paper: the world holds infinitely many things to learn, so you can generate datasets forever and there will still be more — and a human always decides what's worth generating. #ai #syntheticdata #machinelearning #llm
06
Voice agents are one of the hottest use cases in enterprise right now, but also one of the hardest to actually take live. Getting latency low enough to feel human without dumbing down the responses, making reliable tool calls to a CRM without dropping the customer mid-call, building fallback models for when your main provider goes down. None of it is as simple as the demos make it look. Basil Chatha hosted a fireside chat with five eng leaders who deal with this stuff every day: Basia Sudol (Head of Enterprise Solutions, Decagon), Varun Singh (CPTO, Daily), Steven Diaz (FDE Manager, Vapi), Ty
07
Papers
01
EarthVerse 基于 199 个真实灾害事件和 19 类 hazard,提供 405 项可复现的包级任务,要求 Agent 检查异源证据、选兼容数据、做透明计算、协调尺度并保存 provenance。评测 25 种模型/Agent,最高答题单元准确率 84.65%,但 Strict@95 仅 34.81%,说明即使局部步骤正确,端到端科学可靠性仍有显著缺口——Agent 在证据获取、工具选择、记忆、推理、交互及物理解释上难以保持一致链条。此基准为评估动态地球系统中科学 Agent 的端到端可靠性提供了可复现、细粒度的测试床,对构建能在真实灾害场景中稳健推理的 AI 系统有直接参考价值。
02
该文针对恶意数据包识别中的增量少样本学习问题,提出结合自监督预训练骨干、LoRA 低秩适配及原型分类头的混合框架,以在保留旧知识的同时用极少标记学习新恶意类别。实验表明其在多个数据集上显著优于现有 FSCIL 基线,达到 SOTA。这对需要快速增量更新且资源受限的恶意流量检测系统有直接启发。
03
论文指出,当多智能体LLM直接交换完整解时,答案会在一轮内趋同,导致多样性被抹平——即交互税。作者通过在匹配预算的11个验证评分任务中比较完整方案交互与独立生成,发现独立方案能保持多样性而交互往往只让智能体停留在第一个看到的解。这提醒Agent产品设计:性能取决于交换的信息而非智能体数量,只有在关键时刻共享有用信息才有益。
04
本文提出惯性流形神经算子(IMNO),利用耗散系统随时间趋向的低维流形结构,替代标准神经算子(如FNO)进行长时序自回归预测;对平移等变 PDE 再加入 IMNO‑SE 以保持空间平移对称。相比现有方法,IMNO 在解释性、精度和长时间稳定性上均有提升,对需要可靠长 horizon 预测的 Agent 或仿真系统尤为有用。
05
06
07
现有代码agent基准只验证行为正确,无法确认整仓库迁移是否真的完成,易被agents通过复制原实现蒙混过关(Blindness)。作者提出SWE Refactor Bench,包含20个全仓库迁移任务,覆盖四类技术债,并设计三阶段评估——迁移审计、行为测试和Agentic验证——同时度量迁移完整度和行为正确性。在8种前沿模型的520次运行中,仅5.4%通过全部三阶段,最好模型仅得47/100,表明当前agent在长跨度、全仓库重构上仍远未可靠,值得关注此基准如何推动可靠迁移agent的发展。
08
08
Issue Monitor
Ready now—Actionable issues
Needs review—Awaiting a fresh check
Data statusCheck statusLive status unavailable





