ChatGPT的中文回答总体上是准确的,在专业程度、政策时效性、文化背景以及长篇叙述方面存在一定的差距。它可以很好地应对日常生活中的对话、基础知识的学习以及一般的科技说明等工作,对于口语化的语言,“怎么办”、“很靠谱”这样的非正式用语也能很好地识别出来,并且在古诗词续写、成语来源追溯、Python错误解析等方面的表现也很稳定;但是当涉及到《消费者权益保护法实施细则》2024年的最新规定、新华社通稿的语言风格或者是公文级别的成语使用或者发票结构化的识别等问题的时候,它的回答就会出现出处错误、时间判断不准、语气不当或者逻辑断裂的情况——这是因为它的训练数据主要来自英文,而中文有自己独特的分词方式、意合结构以及知识更新的方式,两者之间存在着客观上的不匹配之处。

专业政策类的问题要防止时效性的错误
ChatGPT对于中文法律条文、行政法规以及行业的新规定所做出的回答很大程度上取决于它所接受的数据截止日期。经过测试可以发现它的知识库大多停留在2023年下半年左右,并不能正确地识别出自2024年1月起施行的《消费者权益保护法实施条例》第27条有关自动续费的责任内容,在很多时候还会把它们当作没有生效或者错误地认为是旧版征求意见稿来处理。而国内主流的大规模语言模型则已经通过API的方式实现了和国家法律法规数据库以及部委网站信息同步的功能。如果用户想要获得最新的政策解释的话,在提问的时候最好加上“按照2024年1月开始执行的新版本为准”的字样,并且要对照国务院客户端、市场监管总局官网上的原文进行核实。
二、正式的语言和公文的表达方式有结构上的限制
在新闻通稿、政府文件、企业信函等场合下要突出主谓一致、动宾简洁、不使用被动语态以及避免抽象名词堆积的现象。而ChatGPT所生成的内容仍然沿袭着英语的SVO句型习惯,在把“企业实现降本增效”的时候直接翻译成了“成本降低和效率提高已经完成”,然后再转换成中文的时候出现了“被实现”的情况,“成本降低和效率提高已经被实现”。经过测试之后,在要求改成新华社风格的情况下,它并没有主动地使用到“聚焦”、“推动”、“提升”这样的动词链条,并且也没有避开“通过……的方式”这样的一种西方式的介词结构。这时可以采用一种叫做“指令强化法”的方法来解决这个问题:第一句话就限定好,“请务必使用主动语态、四字短语以及动宾结构,禁止使用‘被’字句和‘通过’引导的状态语。”
第三条 文化语义和术语要进行人工校对
虽然可以基本涵盖成语出处、古籍引用和方言解释这三方面内容,但是容易出现偏差的地方主要是细节部分。比如,“筚路蓝缕”被错误地标注为出自《史记》,并且造句也脱离了公文体式的庄重要求;对于诸如“供给侧结构性改革”、“新质生产力”之类的带有政治经济学色彩的概念,在缺少中央文件级别的权威依据的情况下很容易掺杂进一些非正式的语言表达方式。因此,在涉及到政策、典籍或者公文的时候应该给重要的词语加上引号,并且还要给出一个验证命令:请说明该表述出现在二十届中央财经委员会第一次会议上完整的句子是什么。
四、多模态中文任务需要依靠外部工具链
对于含有发票截屏、手写说明和表格识别等多种形式的数据进行混合输入的情况下,由于ChatGPT本身没有图片的理解能力,所以需要调用GPT-4来分步骤地做OCR以及逻辑推理的工作,并且不能把“2025年03月12日至15日”转换成“3月12号到15号”的格式也没有办法去触发出差天数校验规则。如果要快速完成这样的工作的话,最好选用可以实现从头到尾图文理解的国产模型或者是先把专业的OCR工具用来提取出结构化的文字信息之后再粘贴到聊天框里进行第二次分析。
因此,ChatGPT的中文能力可以用于日常生活中的交流以及简单的信息检索,但是在涉及到政策实施、公文撰写、文化考证和具体业务落实的时候仍然需要参考官方资料进行校对或者选择更适合中文语境的本地化模型。







评论区 (0)
暂无评论,快来抢沙发吧!
发表评论