Skip to content

智谱 GLM 系列模型参数说明 ​

本文档整理智谱 GLM 系列模型的官方参数,包括各模型规格,以及深度思考、流式输出、工具调用、结构化输出等核心能力的调用参数说明。

模型介绍 ​

GLM-5.3 ​

参数项数值
上下文窗口1M
最大输出128K
输入模态文本
输出模态文本
思考模式强制开启,thinking.type 仅支持 enabled,关闭报错

关键调用参数:temperature 默认 1.0,top_p 默认 0.95,建议只选一个调参;reasoning_effort 支持 low / high / max(默认 max)。支持 tool_stream=true 流式工具调用。

思考功能参数:

ParameterValuesDefaultDescription
thinking.typeenabledenabled仅支持开启思考,不支持禁用思考
reasoning_effortlow, high, maxmaxlow-轻量推理;high-增强推理;max-深度推理

GLM-5.3-Flash ​

参数项数值
总参数量320B
激活参数量18B
上下文窗口1M
最大输出128K
输入模态视频、图像、文本、文件
输出模态文本
架构类型首个采用稀疏注意力与线性注意力混合架构的开源前沿模型
思考模式强制开启,thinking.type 仅支持 enabled,关闭报错

参数说明:文本参数与 GLM-5.3 保持一致,支持 1M 上下文。

图片参数:在 messages[].content[] 中添加 type: image_url 内容块,通过 image_url.url 传入图片 URL(推荐)或 Base64 Data URL;多图可添加多个 image_url。

推荐调用参数:temperature: 1、top_p: 0.95、reasoning_effort: max;thinking.type 仅支持 enabled,建议 thinking.clear_thinking: false;流式调用建议同时开启 stream: true 和 tool_stream: true。

GLM-5.2 ​

参数项数值
总参数量744B
激活参数量约 40B
上下文窗口1M
最大输出131,072 tokens
输入模态文本
思考模式默认开启

GLM-4.7-Flash ​

参数项数值
参数量级别30B 级 SOTA 模型
上下文窗口200K
最大输出128K
输入模态文本
输出模态文本

GLM-4.5 ​

参数项数值
总参数量355B
激活参数量32B
上下文窗口128K
输入模态文本
输出模态文本

思考模式:通过 thinking.type 控制,支持 enabled(动态)和 disabled(禁用),默认开启。高速版本实测生成速度超过 100 tokens/秒。

GLM-4.5-Air ​

参数项数值
总参数量106B
激活参数量12B
上下文窗口128K
输入模态文本
输出模态文本

GLM-4.5V ​

参数项数值
总参数量106B
激活参数量12B
输入模态视频、图像、文本、文件
输出模态文本

GLM-4.6 ​

参数项数值
总参数量355B
激活参数量32B
输入模态文本
输出模态文本

GLM-4.6V / GLM-4.6V-Flash ​

参数项GLM-4.6VGLM-4.6V-Flash
总参数量106B9B
输入模态图像、视频、文本、文件图像、视频、文本、文件
输出模态文本文本

推荐解码参数(GLM-4.6V-Flash):top_p: 0.6、top_k: 2、temperature: 0.8、repetition_penalty: 1.1、max_generate_tokens: 16K。

模型能力 ​

深度思考 ​

深度思考(Thinking)高级推理功能,通过启用思维链(Chain of Thought)机制,让模型在回答问题前进行深层次的分析和推理。这种方式能显著提升模型在复杂任务中的准确性和可解释性,特别适用于需要多步推理、逻辑分析和问题解决的场景。

功能特性 ​

深度思考功能目前支持 GLM-5.3、GLM-5.3-FLASH、GLM-5.3-FLASHX、GLM-5.2、GLM-5.1、GLM-5、GLM-5-Turbo、GLM-5V-Turbo、GLM-4.7、GLM-4.6、GLM-4.5 等系列最新模型。通过启用深度思考,模型可以:

  • 多步推理:将复杂问题分解为多个步骤,逐步分析解决
  • 逻辑分析:提供清晰的推理过程和逻辑链条
  • 提升准确性:通过深度思考减少错误,提高回答质量
  • 增强可解释性:展示思考过程,让用户理解模型的推理逻辑
  • 智能判断:模型自动判断是否需要深度思考,优化响应效率

核心参数说明 ​

  • thinking.type:控制深度思考模式
    • enabled(默认):启用动态思考(GLM-5.2、GLM-5.1、GLM-5、GLM-5-Turbo、GLM-5V-Turbo、GLM-4.6、GLM-4.6V、GLM-4.5 为模型自动判断是否思考,GLM-5.3、GLM-5.3-FLASH、GLM-4.7、GLM-4.5V 为强制思考)
    • disabled:禁用思考,直接给出回答
  • reasoning_effort:控制开启思维链下的推理程度,仅 GLM-5.2 及以上支持
    • 可选值:max(默认且推荐,深度推理)、high(增强推理)、low(轻度推理,仅 GLM-5.3 支持)
    • 在 API 请求中
      • 针对 GLM-5.3、GLM-5.3-FLASH、GLM-5.3-FLASHX,仅支持 max、high、low,其余输入将报错;
      • 针对 GLM-5.2,支持 max(默认且推荐,深度推理)、xhigh、high(增强推理)、medium、low、minimal、none,其中 none 或 minimal 代表模型放弃思考;low / medium 映射为 high;xhigh 映射为 max
    • 在 Coding Plan 请求中
      • 针对 GLM-5.3、GLM-5.3-FLASH、GLM-5.3-FLASHX,none、minimal、low 映射为 low;medium、high 映射为 high;xhigh、max 映射为 max
      • 针对 GLM-5.2,none 或 minimal 代表模型放弃思考;low / medium 映射为 high;xhigh 映射为 max
  • model:支持深度思考的模型,GLM-4.5 及其以上版本支持。

思考模式 ​

默认思考行为 ​

GLM-5.3、GLM-5.3-FLASH、GLM-5.2、GLM-5.1、GLM-5、GLM-4.7 系列默认开启 Thinking,这一点不同于 GLM-4.6 的默认“混合 thinking(自动开启)”。如果您想关闭 thinking,请使用以下方式(注意 GLM-5.3、GLM-5.3-FLASH 强制思考不能关闭):

json
"thinking": {
    "type": "disabled"
}

流式消息 ​

流式消息(Streaming)允许在模型生成响应时实时获取内容,而不需要等待完整响应生成完毕。这种方式可以显著改善用户体验,特别是在生成长文本内容时,用户可以立即看到输出开始出现。

功能特性 ​

流式消息采用增量生成机制,在生成过程中将内容分块实时传输,而非等待完整响应生成后一次性返回。

核心参数说明 ​

  • stream=True:启用流式输出,必须设置为 True
  • model:支持流式输出的模型

响应格式说明 ​

流式响应采用服务器发送事件(Server-Sent Events, SSE)格式,每个事件包含:

  • choices[0].delta.content:增量文本内容
  • choices[0].delta.reasoning_content:增量思考内容
  • choices[0].finish_reason:完成原因(仅在最后一个 chunk 中出现)
  • usage:令牌使用统计(仅在最后一个 chunk 中出现)

工具流式输出 ​

流式工具调用(Stream Tool Call)是智谱最新模型的特性,允许在工具调用过程中实时获取推理过程、回答内容和工具调用信息,提供更好的用户体验和实时反馈。

功能特性 ​

工具调用响应的流式输出,这允许开发者在调用 chat.completions 时,在不进行缓冲或 JSON 验证的情况下流式传输工具使用参数,从而减少调用延迟,提供更好的用户体验。

核心参数说明 ​

  • stream=True:启用流式输出,必须设置为 True
  • tool_stream=True:启用工具调用流式输出
  • model:使用支持工具调用的模型

tool_stream 仅改变工具调用参数的返回方式(由一次性返回变为随流逐步返回),平台不会替您执行工具。收到完整参数后,仍需由应用解析并执行工具、将结果以 role: "tool" 回传 messages 并再次调用模型,才能获得最终回答。

响应参数说明 ​

流式响应中的 delta 对象包含以下字段:

  • reasoning_content:模型推理过程的文本内容
  • content:模型回答的文本内容
  • tool_calls:工具调用信息,包含函数名和参数

工具调用 ​

工具调用(Function Calling)允许 AI 模型调用外部函数和 API,极大扩展了智能体的能力边界,使其能够执行具体操作和获取实时数据。

功能特性 ​

函数调用功能为 AI 模型提供了与外部系统交互的能力,支持多种复杂的应用场景和集成需求。

核心参数说明 ​

  • tools:定义可调用的函数列表,包含函数名、描述和参数规范
  • tool_choice:控制函数调用策略,默认且仅支持 auto

响应参数说明 ​

函数调用响应中的关键字段:

  • tool_calls:包含模型决定调用的函数信息
  • function.name:被调用的函数名称
  • function.arguments:函数调用参数(JSON 格式字符串)
  • id:工具调用的唯一标识符

结构化输出 ​

结构化输出(JSON 模式)可以确保 AI 返回符合预定义格式的 JSON 数据,为程序化处理 AI 输出提供可靠保障。

功能特性 ​

结构化输出功能为 AI 模型提供了严格的数据格式控制能力,支持多种复杂的数据结构和验证需求。

核心参数说明 ​

  • response_format:指定响应格式,设置为 {"type": "json_object"} 启用 JSON 模式
  • model:使用支持结构化输出的模型
  • messages:在系统消息中定义期望的 JSON 结构和字段要求