跳转到内容

深度思考 (Thinking Mode)

深度思考 (Thinking Mode)

Google Gemini 3 系列模型原生引入了深度思维推理机制(Chain of Thought)。AMC WebUI 为其提供了全面的控制与交互展现能力。


思考控制维度

进入 设置 -> 模型与生成参数 (Generation Settings),可针对当前模型配置思考行为:

1. 推理等级 (Thinking Level)

针对 Gemini 3.x 模型,提供了以下 4 级档位:

  • Minimal:仅执行最基础的内部一致性检查(注意:gemini-3.7-flashgemini-3.8-flash 官方限制不开放 Minimal 级别,使用时请选择 Low)。
  • Low:轻量级推演,适合日常简单问答与快速响应。
  • Medium:标准平衡模式,推荐用于大部分涉及逻辑和工具调用的任务。
  • High:全马力深度思维演算,充分探索逻辑分支,适合算法设计、疑难排查。

💡 快捷切换技巧:在输入框输入 /fast 并回车,即可在 Low 与 High 之间快速切换,无需进入设置面板。

2. Token 思考预算滑动条 (Thinking Budget)

  • 用户可在 12832,768 Tokens 之间自由拖动预算滑块。
  • 设置为 -1 时,代表由模型根据问题的复杂度自行决定需要的思考量(Auto/Unlimited)。

思维链可视化与交互

在聊天界面中,模型的思考过程会以优雅的折叠容器呈现:

  • 实时流式展现:在模型开始吐出最终回答前,你可以实时观察 AI 的脑力推演、假设检验和自我反思。
  • 耗时与消耗统计:思考完成后,容器会显示推演耗时(秒)以及思考 Token 占用量。
  • 多轮对话保留 (Thought Signatures):在多轮复杂上下文中,AMC WebUI 会完整保留上轮思考特征元数据,确保深度对话的连续性。

思维链实时双向翻译 (Thought Translation)

很多时候,大模型在深度思考时倾向于使用英语进行逻辑推演。 为了提升中文阅读体验,AMC WebUI 内置了 思维链自动翻译 功能:

  1. 开启设置中的「思维链自动翻译」开关。
  2. 应用会在后台调用极速的 gemini-3.5-flash-lite 模型,将模型的英文思考过程近乎无感地翻译为中文。
  3. 翻译过程在后台并行执行,不会阻塞主回复内容的流式输出。