leikooo
@编程小助手 微信: leikooo_
·06-15 10:33
最近看到一篇文章,讲的是大模型的 context window(上下文窗口)。 作者把上下文分成两个区域:大约 10 万 token 以内是「智能区」(smart zone),模型表现更敏锐;超过之后进入「愚钝区」(dumb zone),注意力开始衰减,容易忘记较早的内容。作者强调,这个分界线和厂商宣传的 context window 有多大,关系不大! 这一点也有研究侧面支持,https://arxiv.org/abs/2404.06654https://research.trychroma.com/context-rot:有效可用上下文往往只是宣传值的一小部分,而且窗口越满,性能越容易逐渐下降。 作者原文里有一段话说得很直白:「大上下文窗口在很大程度上只是营销数字。背后的架构确实能工作,但它们掩盖了一个底层注意力机制并未真正解决的问题:包装盒上的数字每一代都在变大,真正可用的部分却没有跟上。」 作者的应对方式也很有意思:开一个新会话,把一份自己写的 spec 传进去。这比自动摘要信息密度更高、交接更有效,因为「接下来什么才重要」由自己决定,而不是交给已经退化的模型去猜。这相当于把「留面包屑」的思路用在 Agent 上——留下一份清晰的交接物,让下一个会话,或下一个人,都能顺顺当当接上来。 原文:https://garrit.xyz/posts/2026-05-06-dont-trust-large-context-windows
0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
下载 APP