GPT-6 Sol 发布当天OpenAI 给出的口径是错误约减半、价格减半。一天后Artificial Analysis 的独立评测出来了——这份评测的价值在于它既确认了 OpenAI 没吹的部分也把没说的代价摆了出来。先给结论Sol 是一次很扎实的发布但它最引人注目的幻觉率下降有一部分是靠少回答实现的。一、第三方确认的部分GPT-6 Sol (max) vs GPT-5.6 Sol (max)Artificial Analysis 实测定价$2/$10较前代减半智力指数与前代持平编码代理指数57上升 2 分Terminal-Bench 4.043% vs 37%SWE-Atlas-QnA58% vs 54%单任务成本智力指数$1.06 vs $1.99约省一半单任务成本编码代理$2.99约省一半位于 Pareto 前沿智力指数持平、编码代理上升 2 分、成本减半——这三行连起来读才是这次发布的准确定义不是能力跃迁是把同等能力便宜一半地重新上市。AA 的判断是 Sol 占据了 Coding Agent 指数 vs 单任务成本的 Pareto 前沿这个说法我认同。还有一个容易被忽略的细节Sol 每任务多用了输出 token31k vs 29k。也就是说成本下降完全来自单价不是来自它变得更省 token。这一点和 Opus 5.5省 token 又降价的路线恰好相反。二、幻觉率 92% → 60%好事但要看清机制AA-Omniscience知识与幻觉基准的数据最扎眼AA-Omniscience 幻觉变化幻觉率92% → 60%答题尝试率99% → 83%错误答案数减少约四分之一答题准确率59% → 54%反而降 5 分AA-Omniscience 指数22 → 27把这五行放在一起机制就清楚了Sol 幻觉变少主要不是因为它知道得更多而是因为它更敢说不知道。尝试率从 99% 掉到 83%——那 16% 不再硬编的题原本大部分是幻觉重灾区。我对这件事的看法是正面的但要纠正一个流行误读这不是准确性提升 32 个点而是不确定性处理变好了。在 QA 型产品里这是巨大进步但在知识密集型工作里那 5 分的准确率下降意味着你遇到的自信的错误比例可能没怎么变——只是总量少了。Luna 的同款数据也顺手列一下幻觉率 93% → 77%准确率 44% 基本持平Omniscience 指数从 -10是的负分到 1。三、第三方指出的两处退步这次评测最有价值的信息其实是退步项OpenAI 的发布材料里没有提GDPval-AA v2.1覆盖 44 个职业的经济价值任务基准Sol 掉了约 100 EloLuna 掉约 75AA-Briefcase v1.1跨数周的知识工作项目、数千输入文件的私有评测Luna 掉约 45 EloSol 持平。AA 团队人工检查了数百个输出后给出的归因是交付物变短了展示质量下降更常漏掉评分项要求的要素。这个发现对实际选型很重要。如果你的场景是生成报告、方案、长文档这类知识交付物Sol 的退步是真实存在的如果只是编码和 Agent 调用则不受影响。这也是我一直建议用自己的评测集而不是榜单做决策的原因——榜单的均值会把这些结构性差异抹平。四、缓存重设计被低估的另一半这次降价 OpenAI 归因于缓存与推理改进其中缓存部分有实料改变 reasoning effort 或可用工具不再使已缓存上下文失效——这对 Agent 是关键以前调整工具集就要重算整个前缀缓存读取享受 90% 折扣与 5.6 系列一致写入溢价 25%OpenAI 披露 GitHub 上 billions 级请求的数据需要新鲜处理的 prompt token 份额下降超过 50%直接反映在 Copilot 的延迟与成本上。配合前面说的多花 2k 输出 token整个成本模型的正确理解是OpenAI 把钱从重复读前缀上省下来贴到多写输出上去了。长对话、Agent 场景受益最大单轮短问答场景感受会弱一些。五、我的判断以及保留意见判断Sol 是防守反击型发布能力不冒进、价格直接砍半目标是守住中间价位段。考虑到 Anthropic 的 Opus 5.5 比 OpenAI 的发布早 90 分钟这个时间点本身就是回应幻觉治理路线值得行业注意。少回答换少犯错是比全部硬答更诚实的取舍预计会成为后续模型的普遍选择——但对下游产品意味着要做拒答兜底设计GDPval 的退步是选型分水岭。编码/Agent 负载选 Sol 很划算长文档交付类负载建议等一等或保留前代。保留意见OpenAI 内部事实性评测错误减半、接近 Astra 级可靠性是基于自有评测、以自家前代为参照的口径跨实验室对比仍需等独立数据AA 的 GDPval / AA-Briefcase 退步结论基于其私有 harness 与人工抽检样本与方法未完全公开方向可信、幅度存疑所有 max effort 数据默认 effort 下表现会有差异评测前先确认档位。一句话总结这一代 GPT-6 Sol 的故事不是更聪明是同样聪明但诚实了一半、便宜了一半。对大部分开发者这比变聪明有用。资料来源Artificial Analysis《GPT-6 Sol and Luna push the cost efficiency frontier》2026-09独立实测OpenAI 官方发布公告与 Better Prompt Caching for GPT-6 说明MacRumors、AI Industry Today、AI Chat Daily 报道2026-09-22/23。本文基于第三方独立评测与官方公告整理数据以 AA 原文为准不构成投资建议。#GPT-6 Sol#Artificial Analysis#幻觉#大模型评测#OpenAI#成本优化 SEO 优化官网定制响应式建站教育培训建站