Erik Yu@M1HengAug 11Codex over engineering 非常严重。 Sonnet 5 也有一些。 我在想是不是 engineering 这些 benchmark 的高分,同时意味着 think of every aspect,从而导致 agent 在实际工程中为了各种极其细微的 case 而设计一整套极其恶心的架构。 RL 需要跨周期的迭代case。2122
Erik Yu@M1HengAug 9也许「讲人话」和 agentic 能力之间,本来就存在某种 trade-offZEN@supezenAug 9有件事我想不通: 既然 skills 都可以教模型讲人话,那为什么厂商不直接训练出讲人话的模型?这个很难?255