Gemini 3.8 Flash 半价到年底:能力白送一档,升级要改三处

一句话结论:Gemini 3.8 Flash 正式版(GA)上线,体验价输入 0.75 美元、输出 3.75 美元每百万 token,只有标准价一半,放到今年 12 月 31 日;能力主打长程软件工程和自主智能体,但老代码升级过来,有三处参数必须改。
六周,三个版本。
Google 的 Flash 系列把「月更」卷成了「半月更」。9 月 2 日,Gemini 3.8 Flash 官宣 GA——不是预览,是能直接上生产的正式版。而另一边,Gemini Pro 系列已经好几个月没动静,社区里「Google 是不是放弃 Pro 了」的调侃就没停过。
先看速览:
| 项目 | 内容 |
|---|---|
| 模型 | Gemini 3.8 Flash(gemini-3.8-flash) |
| 状态 | 正式发布 GA,可用于生产环境 |
| 上下文 | 100 万 token,输出最多 6.4 万 token |
| 体验价 | 输入 $0.75 / 输出 $3.75 每百万 token(至 2026-12-31) |
| 定位 | 长程软件工程、自主智能体、企业工作流 |
这次升级了什么
官方给 3.8 Flash 的定位原话是:最智能的 Flash 模型,专为长期软件工程、自主智能体和复杂的企业工作流而设计。
拆开是三个方向。
长程软件工程:在实际编码基准、复杂的多文件重构、确定性工具执行上拿出了官方所称的前沿成果。翻译成人话:让它跑几个小时的大活儿,比如跨几十个文件的重构,它比前代稳。
自主智能体:官方描述是「构建弹性多步规划和工具编排工作流,大幅减少失败的循环和错误」。Agent 跑一半卡死、工具调用陷入死循环,这类问题正是 Flash 系列以前的短板。
企业工作流:严苛领域任务和大规模数据流水线,强调准确性和事实严谨。
还有一个容易被忽略的消息:Google 自家的托管智能体 Antigravity,默认模型已经悄悄切到了 3.8 Flash,Antigravity SDK 也一样。自家最新的 Agent 产品用哪个模型,比任何跑分都诚实。
价格:半价,但有截止日期

这次的价格政策值得单独说。
| 项目 | 体验价(至 2026-12-31) | 标准价(2027-01-01 起) |
|---|---|---|
| 输入 | $0.75 / 百万 token | $1.50 / 百万 token |
| 输出 | $3.75 / 百万 token | $7.50 / 百万 token |
两点注意。
一是体验价不只给 3.8——3.6 和 3.7 Flash 同样享受这个价格,在 Google AI Studio 和 Gemini Enterprise Agent Platform 都适用。这对正在跑老版本的账户是白送的安全垫:升不升级,价格都一样。
二是 2027 年 1 月 1 日起恢复标准价,翻倍。迁移和压测留足时间,别拖到 12 月底。
有个设计细节要心里有数:3.8 Flash 为了在复杂多步任务上提质量,会主动用更多 token——把推理拆成小步、反复调用工具、边跑边自我验证。日常轻量任务请把思考级别调低,或者干脆留在 3.7 Flash(官方原话:3.7 仍然完全受支持)。
怎么用:一个 curl 就能跑
新模型走 Interactions API,最小示例就这么点:
curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-X POST \
-d '{
"model": "gemini-3.8-flash",
"input": "Write a three.js script that renders a realistic 3D black hole."
}'
Python 侧 client.interactions.create(),一个参数就能指定思考级别:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Analyze this payment pipeline for race conditions.",
generation_config={"thinking_level": "medium"},
)
print(interaction.output_text)
思考级别三档:low 给实时聊天、突发告警这类延迟敏感场景;medium 是默认值,官方建议复杂代码和 Agent 用例就用它;high 给深度推理、数学、困难多步任务。
升级前必改的三处
重点来了。官方迁移核对清单里,有三处是不改就出问题的:
第一,删掉 temperature、top_p、top_k。 这三个采样参数在新版生成配置里已废弃,留在代码里就是隐患。
第二,thinking_budget 换成 thinking_level。 数值型预算没了,换成字符串枚举。而且 minimal 这一档在 3.8 Flash 上不支持,传了直接报错——如果你的调度逻辑里有动态取最小值的写法,跑起来就是个 500。
第三,删掉 candidate_count。 一次生成多个候选的能力,Gemini 3 起不再支持。
参数之外还有几处结构性变化:多轮对话改用服务端的 previous_interaction_id 串联;预填充模型轮次被移除;走 generateContent API 的话,FunctionResponse 必须带 call_id 和 name。
改不动?官方自己都建议别手改——装一个 gemini-api-dev 技能,把「迁移到 3.8 Flash」这句话丢给编码智能体,让它自动改。官方文档原话:「使用编码智能体自动执行此迁移」。
对普通开发者意味着什么
三类人建议动。
跑 Agent 工作流的:多步规划、工具编排的稳定性提升是这次的主菜,Antigravity 的默认切换就是官方背书。
API 用量大的:体验价直接砍半,一百万 token 输出省 3.75 美元,量大的账户一个月能省出真金白银。
用 AI Studio 白嫖的:AI Studio 里同样有体验价,注册就能试,先跑分再决定要不要迁。
两类人先别动。依赖 minimal 思考级别的(直接不支持);日常轻量任务为主的——3.7 Flash 同价、继续维护,没有迁移的紧迫性。
🎯 老张建议
- 新项目直接上 3.8 Flash,别从 3.7 起步——同价高能力,还能少迁移一次。
- 老项目盯死 12 月 31 日:体验价截止和标准价生效是同一天,压测、迁移、预算审批都往前排。
- 省 token 从 thinking_level 入手:这不是一个必须拉满的开关,日常任务用 low/medium,成本差好几倍。
💬 互动话题
- 你的 Agent 工作流用的哪家模型?被「工具调用死循环」坑过吗?
- Flash 半年三连更、Pro 四个月没动静,你觉得 Google 的算盘是什么?
- 半价体验价你会囤用量吗,还是等标准价再评估?
🔗 关注老张
公众号:老张聊运维 小程序:观简国学 个人博客:https://www.shanwaiyun.top/