GLM-4.7开源模型深度评测:国产大模型新王者的全面解析
前言
2025年末,当大家的目光都聚焦在智谱AI即将上市的新闻上时,一个更值得技术圈关注的消息悄然发布——GLM-4.7正式开源。作为源码七号站的长期观察者,我第一时间对这个被称为"开源SOTA"的模型进行了全面测试。今天就和大家分享一下这次深度体验的完整报告。
一、GLM-4.7:开源模型的新标杆
1.1 突破性的排名表现
根据权威评测平台Artificial Analysis最新发布的榜单,GLM-4.7以68分的成绩,超越Kimi K2 Thinking,成为全球排名第一的开源模型。
这个成绩意味着什么?让我们看看最新榜单前十名的构成:
- 榜单前十中,有4个国产模型
- 曾经的"AI六小虎"如今只剩两家在前列撑场
- GLM-4.7不仅在开源模型中领先,放在闭源模型里也毫不逊色
1.2 三大核心能力的针对性优化
GLM-4.7并不是简单的全面提升,而是针对三个关键领域进行了深度优化:
推理能力
- 在"Humanity's Last Exam"(人类终极考试)中得分25.1%
- 全球排名第7位
- 这项测试专门考验模型的知识水平和逻辑推理能力
编程能力
- LiveCodeBench测试:全球第3名
- SciCode测试:全球第5名
- 代码生成的准确性和实用性都有显著提升
智能体能力
- τ²-Bench(Telecom)测试得分:96分
- 直接登顶全球第一
- 这意味着模型在工具调用、多步骤任务执行等方面表现出色
二、技术解析:三种思考模式的创新设计
相比GLM-4.6,GLM-4.7最大的创新在于思考模式的设计。模型引入了三种不同的思考机制,让源码七号站的读者们能够根据具体场景选择最优方案。
2.1 交错思考(Interleaved Thinking)
工作原理:
模型在每次生成响应和调用工具之前,都会先进行一次"思考"。
适用场景:
- 需要精确执行指令的任务
- 对生成质量要求较高的场景
- 需要调用外部工具的复杂任务
举个例子:
当你要求模型"用Python写一个数据分析脚本"时,交错思考会让模型先思考:
- 需要导入哪些库?
- 数据处理的步骤是什么?
- 如何组织代码结构?
然后再开始生成代码。
2.2 保留思考(Preserved Thinking)
工作原理:
在多轮对话中,模型会自动保留所有思考块,重复利用已有推理,而不是每次都从零开始。
适用场景:
- 编码代理场景
- 长期复杂任务
- 需要保持上下文一致性的项目
实际价值:
假设你在开发一个Web应用,分多次与模型对话完善功能。保留思考模式可以:
- 记住之前讨论的技术选型
- 保持代码风格的一致性
- 减少重复解释的时间成本
2.3 回合级思考(Turn-level Thinking)
工作原理:
允许模型按回合控制推理计算量,简单请求禁用思考以降低延迟,复杂任务启用思考提升准确性。
适用场景:
- 需要快速响应的轻量级请求
- 对成本敏感的应用
- 混合了简单和复杂任务的场景
智能切换:
- 轻量级请求:"今天天气怎么样?" → 禁用深度思考,快速响应
- 复杂任务:"设计一个分布式系统架构" → 启用深度思考,保证质量
三、实战测试:从工具应用到游戏开发
在源码七号站的测试环境中,我对GLM-4.7进行了一系列实际应用场景的测试。以下是完整的测试报告。
3.1 小红书笔记生成器:内容创作的效率革命
测试提示词:
我是一位小红书博主,请帮我设计一个能根据文字、选题生成小红书笔记的应用,
UI设计为粉紫配色+有柔光聚光渐变。
生成效果分析:
- 核心功能一次直出
- 热门选题推荐模块
- 手动选择主题和风格
- 定制化笔记内容生成
- 结构化笔记输出
- UI设计亮点
- 粉紫配色方案完美实现
- 柔光渐变效果自然流畅
- 交互逻辑符合用户习惯
- 迭代优化便捷性
- 一次迭代即可添加新功能模块
- 代码结构清晰,易于维护
- 适合快速原型开发
实用价值:
对于内容创作者来说,这个工具能够:
- 解决选题困难问题(热门选题推荐)
- 提升创作效率(一键生成结构化笔记)
- 保持风格一致性(可定制化设置)
3.2 贪吃蛇游戏:复杂逻辑的精准实现
测试提示词:
写一个贪吃蛇游戏,要求要有会掉分的毒果子,地图也丰富一些,
比如有石头、草之类的障碍物,首页做的好看一些,有游戏说明。
实现效果:
- 基础游戏机制
- 经典贪吃蛇移动逻辑
- 食物生成系统
- 碰撞检测机制
- 创新元素
- 毒果子系统(降低分数)
- 多样化障碍物(石头、草丛等)
- 地图元素随机生成
- 用户体验优化
- 精美的首页设计
- 详细的游戏说明
- 流畅的动画效果
开发体验:
- 仅需3次轻度迭代即可达到演示效果
- 建议选中"全栈开发"场景获得更好效果
- 可通过简单对话持续优化游戏体验
技术启示:
这个测试证明GLM-4.7在游戏逻辑处理上的能力:
- 能够理解复杂的游戏规则
- 准确实现多层级的交互逻辑
- 代码结构合理,便于扩展
3.3 前端设计:审美能力的显著提升
很多人评价GLM-4.7这次属于"理科生逆袭",审美能力有了大幅提升。在源码七号站的测试中,我特别关注了前端风格的把握能力。
赛博朋克风格测试
视觉效果:
- 霓虹色调运用恰当
- 科技感元素融合自然
- 整体氛围营造到位
交互设计:
- 动态效果流畅
- 按钮和元素响应及时
- 信息层次分明
可编辑性:
- 点击右上角可进入编辑模式
- 支持直接修改文字内容
- 可通过自然语言调整样式
文艺清新风格测试
设计特点:
- 配色和谐大方
- 页面布局舒适
- 配图具有设计感
适用场景:
- 个人博客网站
- 文创产品展示页
- 艺术作品集网站
3.4 PPT自动生成:办公场景的智能助手
测试案例:成都城市介绍PPT
提示词简单程度:
做一个介绍成都的PPT
自动化流程:
- 自动搜集相关资料
- 智能规划PPT结构
- 填充内容和数据
- 生成完整演示文稿
数据准确性验证:
- 人口数据:准确
- 经济指标:最新
- 文化信息:详实
- 旅游景点:全面
实用价值:
对于职场人士来说,这个功能能够:
- 节省大量资料搜集时间
- 自动生成结构化内容
- 提供专业的视觉设计
- 支持快速修改调整
3.5 海报设计:营销物料的快速生产
跨年活动海报
设计要求:
元旦跨年烟花活动宣传海报
生成效果:
- 节日氛围浓厚
- 视觉冲击力强
- 信息传达清晰
城市主题海报
测试案例:
北京城市宣传海报
设计亮点:
- 地标元素突出
- 文化特色鲜明
- 色彩搭配专业
3.6 3D体素艺术:创意设计的新可能
测试提示词:
Design and create a colourful voxel art of minion super detailed
with perfect lighting with animated scenery.