← 返回首页
Blog
第 1 页 · 本页 5 篇 · 共 5 篇
- 从 pass@k 到 pass^k:为什么 Agent 评测要看「连续通过」
pass@k 衡量能力上限,pass^k 衡量生产可靠性。本文拆解两者的数学差异,以及 Ground Truth 隔离、故障注入、结果评测与轨迹评测怎样配套。
6 min read - Prompt 定意图,Hook 定边界:Agent 的确定性从哪来
模型适合表达意图,不适合充当安全边界。拆解 Before/After Tool Hook 链如何应对越权调用、上下文膨胀与过程失忆三类 Agent 固有问题。
6 min read - 从一次请求读懂 Pi:Agent Runtime 与 Coding Harness 源码剖析
沿着一次读取 package.json 的请求,拆解 Pi 的模型适配、Agent Loop、工具执行、上下文投影、事件流与 Session 持久化。
35 min read - 凌晨两点以后,我开始理解 Hackathon
一次 AdventureX 黑客松复盘:从选题、组队和开发,到 Demo、路演与产品判断,我重新理解了 Builder 的责任。
7 min read - 从 Hacker 到 Founder:在选择里对整件事负责
AI 小酒馆「从 Hacker 到 Founder」的一场夜聊:初心决定往哪走,判断决定怎么下注,责任决定选择以后怎么扛。
8 min read