跳到正文

Tag archive

#大模型

5 篇 · 按时间倒序

2026-09-03

把加密思考块喂给小模型,拿到了最值钱的思维链

CoT 思维链蒸馏能提供更密集的监督信号帮助小模型学习任务拆解,但商业 API 往往将推理过程打包隐藏。旧版 Claude 思考块因缺乏上下文绑定被廉价提取,Anthropic 在 Fable 5.1 正式上线保留思考机制,从协议层封堵了跨模型与篡改前缀的蒸馏通道。
2026-09-02

用 API 中转站跑代码,你买的 Fable 5 可能背地里被掉了包

大模型 API 中转站标着 Fable 5,背后可能加价 1.09 倍卖给你 9B 小模型。安全研究发现近半数中转接口存在掉包,准确率甚至从 83% 断崖跌到 37%。代码跑不通时,别把中间商偷换算力的损耗,当成自己学习 AI 的学费。
2026-08-11

这篇文章被判 70% 像 AI,Claude 水印却不看文风

一篇文章被判 70% 像 AI,不等于检测到了水印。Claude 文本水印很可能藏在 token 选择的统计偏差里,而非文风。
2026-08-07

2023 年我判断中国大模型没戏,三年后我发现少写了一个期限

中国大模型在 2023 年看起来很难追上,三年后,“没戏”的判断已经站不住。长期预测最容易漏掉期限,也低估了系统改变趋势的能力。
2026-03-24

KV Cache:为什么 AI 回复越来越快?

KV Cache 是大模型能快速响应长对话的核心机制:将历史内容的中间计算结果缓存起来,避免每次生成新词都重新计算所有上文,以显存空间换取时间,同时大幅降低 API 调用成本。