GPT-4为底层的大规模预训练模型,而ChatGPT则是以GPT系列为基础所创建出的一个可以进行对话的应用程序,并不能够直接比较两者之间的优劣。GPT-4是由OpenAI公司推出的第四代的基础语言模型,它的参数数量大约在五千亿到一万亿之间,并且能够接受包括文字和图片在内的多种形式的数据输入,在经过大规模高质量的数据集训练之后,在逻辑推理、复杂的命令解析以及不同领域的知识融合等方面的能力都得到了很大的提升;而最初的ChatGPT是根据GPT-3.5来开发出来的,并且现在的一些版本中已经加入了GPT-4的技术内容,在本质上它只是一款为了方便用户的交互而设计的产品,它的优点在于操作简单、对话顺畅,但是缺少底层的技术自主性;模型的进步主要表现在结构的设计、训练的方式以及所能达到的功能范围这三个方面,并不是终端界面的表现情况。

从模型结构和训练方式的角度来分析技术的不同阶段
GPT-4使用的是混合专家(MoE)架构,在每一轮推理的时候只激活大约百分之十左右的参数子集来达到既保证了计算效率又保持了强大的能力的效果;而GPT-3.5则是用全部参数进行运算,资源耗费大并且扩展性差。在训练数据上,GPT-4采用了大量的高质量图文配对语料,并经过多次的人工反馈强化学习以及宪法式的AI对齐训练来提高它的事实核查能力、伦理判断能力和长时间的一致性,在MMLU、GPQA和HumanEval这些权威基准测试中都达到了接近人类专家级别的表现,其中MMLU得分为86.4%,比GPT-3.5高出很多。这样的进步不是靠简单的参数堆积实现的,而是由于训练策略、数据清理的标准以及对齐的方法都得到了系统的改进。
二、根据能力边界以及实际的应用去检验它的先进性
GPT-4具有原生的多模态理解能力,可以直接解析用户上传的图表、手写公式和截图中的表格,并且可以做逻辑推理;如果ChatGPT没有接入GPT-4版本的话,那么它就只能进行纯文本式的交流,不能处理图片输入的问题,在复杂的任务测试当中,GPT-4可以完成从比较三个电路图找出故障点到给出修复方案再到写出适合Arduino使用的代码整个过程,而GPT-3.5通常会在第二个环节就出错。OpenAI官方表示,在法律、医学等领域幻觉率降低了大约四成的原因是由于加入了风险分类器以及实时的内容过滤层,并不是靠简单的提示词工程就可以做到的。
第三种观点是从产品的形式以及和用户的匹配程度来理性的看待定位
ChatGPT属于应用层面的产品,在不断改善对话记忆、扩大上下文窗口(最大可达32K tokens)、丰富插件生态系统以及实现多端同步的同时,它所具有的价值就是把前沿模型的能力以零门槛的形式提供给用户;而GPT-4则需要借助API或者企业的定制方案来使用,并且向开发者开放了更多的权限。普通用户的感受是“更加智能”,其实质上是由于底层模型更新所带来的效果扩散;但是仅仅用来回答一些基本的问题的话,GPT-3.5已经可以满足大部分人的需求了,并不需要为了边际上的性能改进而去付出更高的代价。
因此先进性要回到技术本身去,GPT-4就是目前的大模型在结构创新、数据质量和对齐程度等方面取得的整体进步,而ChatGPT则是它能力实现的重要工具,两者之间存在“发动机和汽车”的关系。






评论区 (0)
暂无评论,快来抢沙发吧!
发表评论