Gemini 3.5 Flash 默认使用 medium 思考,API 可用 minimal、low、medium、high 调节推理深度;多轮工具调用要原样保留模型返回的所有 parts/思维签名。
适合的任务:Gemini API 的编码、数据分析、文档处理、函数调用和多步 Agent 工作流。
不适合的任务:把 Gemini 2.5 的 thinkingBudget 参数直接用于 Gemini 3.5 Flash,或删除多轮函数调用中的签名部分。
适用的模型版本:gemini-3.5-flash。
适用的客户端、Agent 或 API:Google Gen AI SDK 的 generate_content/generateContent,以及 REST generateContent。
推荐的推理档位和参数:简单分类/事实任务 minimal 或 low;普通任务 medium;复杂编码、数学和规划 high。思考摘要按需启用,生产环境同时记录 thoughts token。
以下代码是依据官方 API 字段和官方示例,将模型名明确替换为 gemini-3.5-flash 的可运行配置模板;模型名替换是为本模型整理的适配,不声称是页面逐字代码。
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.5-flash",
contents="分析这份销售数据,先给出结论,再列出证据和不确定性。",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="high")
),
)
print(response.text)import { GoogleGenAI, ThinkingLevel } from "@google/genai";
const ai = new GoogleGenAI({});
const response = await ai.models.generateContent({
model: "gemini-3.5-flash",
contents: "把这段会议记录整理成 JSON:主题、决策、负责人、截止日期。",
config: {
thinkingConfig: { thinkingLevel: ThinkingLevel.MEDIUM },
},
});
console.log(response.text);curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H 'Content-Type: application/json' \
-X POST \
-d '{
"contents": [{"parts": [{"text": "将以下文本分类为 bug、feature 或 question,只返回类别。"}]}],
"generationConfig": {
"thinkingConfig": {"thinkingLevel": "low"}
}
}'from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.5-flash",
contents="比较两个方案,给出推荐和关键风险。",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(
thinking_level="high",
include_thoughts=True,
)
),
)
for part in response.candidates[0].content.parts:
if not part.text:
continue
print("Thought summary:" if part.thought else "Answer:")
print(part.text)先用默认 medium 建立基线;简单任务改跑 minimal/low,复杂任务改跑 high。
每次运行记录 usage_metadata.thoughts_token_count、输出 token、首 token 延迟、总延迟和费用。
若要调试质量,短期打开 include_thoughts=True 查看摘要;生产输出只保留必要的摘要/日志,不把内部推理当作事实证明。
使用函数调用或多轮对话时,原样传回模型返回的全部 response parts;不要拼接、删除或修改带签名的部分。
不要用 Gemini 2.5 的 thinkingBudget 来控制 3.5 Flash;3.5 Flash 使用 thinkingLevel,支持 minimal、low、medium、high。
官方模型页列出 gemini-3.5-flash:输入上限 1,048,576 tokens,输出上限 65,536 tokens;支持文本、图片、视频、音频、PDF 输入,输出文本。
官方思考表格将 Gemini 3.5 Flash 标为默认 medium,并支持 minimal、low、medium、high;high 可动态提高推理深度。
官方文档说明启用思考后费用包含输出 token 和思考 token;可从 thoughtsTokenCount/对应 SDK usage 字段读取思考 token。
Gemini 3 模型可能为各种 parts 返回思考签名;官方建议按原样传递所有 parts,函数调用多轮尤其不能丢失签名。
文档页面的部分代码示例使用 gemini-3.6-flash 作为当前示例;上文模板仅按同一字段结构替换为本模型 ID,实际 SDK/API 可用性需在目标项目验证。
minimal 不保证完全关闭思考;若需要严格无思考语义,Gemini 3.5 Flash 的官方页面没有提供 thinkingBudget=0 这一配置。
思考摘要是摘要而不是完整内部推理,也不能代替外部证据、测试或人工复核。
1M 输入窗口和 65,536 输出上限是 API 模型页规格,不代表每个客户端、套餐或代理框架都开放相同上限。
官方表格把 Gemini 3.5 Flash 的默认档位标为 medium,并把 high 描述为更深的动态推理。文档同时强调:多轮请求要原样回传带签名的 parts,这是最容易被自定义 Agent 框架破坏的配置细节。
Gemini 3.5 Flash