
*我们挑选了我们认为您会喜欢的产品,并可能通过本页面的链接获得佣金。
核心架构与推理能力
GPT-4 在整个会话中作为单一模型运行,用户需要手动选择模式(如浏览/编程)。推理能力强,但固定,处理复杂任务时可能速度较慢。
GPT-5 引入了统一系统,包括:
- 用于即时响应的快速模型
- 处理复杂问题的 GPT-5 Thinking
- 基于任务类型、复杂性、工具需求及用户明确指令(如“认真思考这个”)选择模型的实时路由器
结果是,简单问题得到快速回答,复杂问题得到更深入、更可靠的分析。
准确性与幻觉减少
GPT-5 比 GPT-4/4o 更少产生错误信息,并且在不确定时会坦诚说明,而不是猜测。奉承率也显著降低,提高了透明度。
性能与评测结果
在数学、软件工程、多模态理解和医疗等领域,GPT-5 的表现持续优于 GPT-4/4o。
| 领域 | GPT-4/4o(参考) | GPT-5(参考) | 主要差异 |
|---|---|---|---|
| 竞赛数学(AIME) | 强大但不稳定 | 刷新纪录;pass@1 显著提高 | 竞赛级别准确性大幅提升 |
| 软件工程(SWE-bench Verified) | 问题解决率中等 | 成功率大幅提高 | 在真实代码库中的表现显著改善 |
| 多模态(MMMU 等) | 静态图像表现良好 | 在图像、视频、图表、空间推理方面更强 | 多模态能力成熟且更可靠 |
| 医疗(HealthBench) | 有用但不稳定 | 迄今最佳;更安全、更精准 | 在现实医疗咨询中显著改善 |
多模态能力
GPT-4 引入了多模态输入,并在静态图像任务中表现出色。GPT-5 更进一步:在图表、科学插图、空间任务和视频分析中的准确性更高。
专业领域
编程: GPT-5 能构建完整的应用和网站,管理大型代码库,并具备更好的美学设计感。
创意写作: 在文学结构处理、隐喻表达和结尾设计上更佳。
医疗: 能更好地理解上下文,主动发现风险并提出后续问题。
安全性、透明度与风格
GPT-5 引入了安全完成(safe completions)机制:尽可能提供有用且安全的答案,必要时才拒绝,并明确解释原因。缺少工具或面对不可能任务时,模型会如实告知。
定制化与用户体验
遵循用户自定义指令的能力显著增强。新增的预设人格(Cynic、Robot、Listener、Nerd)可以快速改变交流风格。
可用性与访问
GPT-5 是 ChatGPT 的默认模型。免费用户在达到使用上限后会切换到 GPT-5 mini。Plus 和 Team 用户拥有更高限额,Pro 用户可使用GPT-5 Pro处理最复杂的任务。
扩展总结:GPT-5 的优势领域
- 自适应推理: 自动切换快速模式和深度思考模式。
- 减少幻觉: 错误率显著低于 GPT-4/4o。
- 透明度更高: 坦承限制与不确定性。
- 减少奉承: 风格更平衡。
- 大型编程项目: SWE-bench 成功率提高,UI 设计更美观。
- 创意写作: 隐喻更丰富,结尾更有力。
- 医疗: 迄今最安全、最精准。
- 多模态: 在图像、视频、图表、空间推理上表现更佳。
- 指令遵循: 多步骤任务执行更精准。
- 函数调用: 工具协作能力增强。
- 推理效率: 用更少的 token 达到更高准确率。
- 定制化: 更好地执行指令,支持预设人格。
- 安全训练: 安全有用的回答,减少不必要的拒绝。
- 减少虚假信息: 不可能任务中的虚假声明减少。
- 企业适配性: 更高上限、更可靠,支持 Pro 级推理。
结论: GPT-4 设立了高标准,而 GPT-5 在更智能的推理、更高的实际准确性、更强的多模态能力、更稳固的安全性以及更流畅的用户体验方面全面超越了它。