孰优孰劣|百度文心一言vs微软ChatGPT
AI与地理

孰优孰劣|百度文心一言vs微软ChatGPT

(编者按:本文所有图片的观点均来自AI大模型的直接回复,无任何导向性,不代表本媒体立场。) (VRPinea2023年3月20日讯)近日,微软举办了“The Future of Work with AI”发布会,重磅发布AI办公助手——Microsoft 365 Copilot。简单来说,Copilot(副驾驶员)是一个搭载了GPT-4大模型能力的AI助手,将接入微软全家桶产品中。而GPT-4,是数日前由OpenAI发布的目前功能最强大的AI大模型。当下,微软Office 365旗下的办公产品包括Word、Excel、Powerpoint、Outlook、Teams等等。一边是全球最大办公软件,一边是最强AI大模型,两者结合堪称“王炸”。 王炸组合里的GPT-4,看上去是不是和去年年底爆火的ChatGPT很相像呢,小P这就来替大家梳理一下它们的关系。 GPT-4是由Open AI开发的最新一代通用语言处理模型,它是GPT系列模型的最新版本,在基础架构、训练数据、模型规模和效果等方面都进行了进一步的升级和改进。 而ChatGPT是GPT系列模型的一个分支版本,它以GPT系列模型为基础,针对聊天机器人这一场景进行了优化和特化,加入了对话生成和上下文理解等特定功能,并对训练数据和架构进行了调整。因此,ChatGPT与GPT-4是同源同宗的模型。 OpenAI靠着ChatGPT实力吸睛,Google带着Bard紧随其后,你方唱罢我登场的AI领域,终于还是出现了“国货”的身影。在微软发布会的不到12小时之前,百度举行了百度文心一言发布会。发布会上百度创始人兼CEO李彦宏展示了文心一言在文学创作、商业文案写作、数理逻辑推算、中文理解、多模态生成等方面的能力。他表示,“今天的文心一言是过去多年努力的延续。但也不能说我们完全ready了,文心一言要对标ChatGPT、甚至是对标 GPT-4的门槛是很高的,全球大厂还没有一个做出来的,百度是第一个。我自己测试感觉还是有很多不完美的地方。” 姗姗来迟的文心一言表现如何?口说无凭,是骡子是马得拉出来遛遛才知道。小P用不同方面的多个问题同时提问两者后发现,文心一言在上下文记忆、联系、纠错等方面逊色于ChatGPT(3.5版),回复问题的速度也存在肉眼可见的差距(未考虑网速原因的影响),这是算力差距带来的鸿沟。尽管ChatGPT更占上风,但文心一言也并不是完全被动“挨打”的角色,在某些比较有“中国特色”的问题上,文心一言的回答反而要出色一些。 小P首先询问了比较常规的日常应用场景的问题,“推荐十首好听的粤语歌”。在这个问题上,ChatGPT的回答中规中矩,推荐了一些较为经典的粤语歌曲,不过存在一些小瑕疵是,比如它推荐了光良的《童话》,《倩女幽魂》的原唱是张国荣等。除此之外,结尾问候语“希望您会喜欢它们!”也算亮点之一,这更接近于正常对话的模式。文心一言的回答就有些不同寻常了,它的回答是一段粤语语音,这对于粤语歌迷来说无疑算是一个小惊喜了。鉴于推荐歌曲大概率不是严肃的场景,那么文心一言没有文字回答,不便记忆的缺点也就无伤大雅了。 接下来是一道带有陷阱性质的高中地理问题,“有一只熊掉到了陷阱里,陷阱深19.617米,下落时间正好2秒。求熊是什么颜色的?”关于这个问题,ChatGPT没有答案,它选择了质疑问题的准确性,“熊掉进陷阱的深度和下落时间并不能确定熊的颜色,这是一个典型的谬误推理”。这体现其出色的思辨性,但不可掩盖的是,它掉进了语言陷阱中,没有发现题目中的隐含条件。而文言一心则通过物理运算和地理知识的推导,得出了熊是黑色的正确答案。果然,在中国文理科知识这样的特定领域问题,文心一言就是比“外国货”懂得多。 (编者按:根据陷阱深19.617米、下落时间2秒的条件,可得出当地的重力加速度为9.8085,进而可以推导出陷阱所在地的纬度大概是44度左右。熊的分布大多集中在北半球,北纬44°分布的只有棕熊和黑熊。深达十多米的陷阱可得出该地土质为冲击母质,而棕熊栖息在高海拔地区,所以,只有黑熊符合条件。) 在关于“如何看待中国央视网认为孔乙己之所以陷入生活的困境,不是因为读过书,而是因为放不下读书人的担子,不愿意靠劳动改变自身的处境?”这一问题的回答上。夸张一些来说,ChatGPT完全吊打了文心一言。前者不仅开篇就提到了“作为一个AI语言模型,我不会对特定观点进行评价,但是我可以尝试解释一下这个观点所表达的意思”这样的句子。并且对这一观点进行了较有思辨性的回复,对比了孔乙己所处时代和当今社会,表述不同观点及其产生的原因,还延伸出了对相关社会问题的思考。而文心一言的回复则更像是一段对题目观点的扩写,给人一种机械死板的感觉。 “请从今年高考的高三学生的角度,写一篇高考誓师演讲稿”,在这个问题上,两者都是表现平平,生成的文章都很模式化,满是一股公关辞令的味道。不过倒也正常,目前来说,我们不能指望两个AI大模型能写出,像前段时间登上热搜的湖南某高中“誓师女孩”那样激情澎湃的演讲。情绪,是AI所不具备的能力。 小P最后还询问了一些文史哲方向的问题,如解读明朝哲学家王阳明四句教的涵义等,文言一心的回答是低于预期的,只能给出一些浅层次的回答,甚至还会给出一些张冠李戴的回复。而ChatGPT的回复则有一定的逻辑性,但在深度层面的理解上依旧是有所欠缺的。在小P看来,这方面的不足是技术局限性的必然结果,AI大模型的“思考”还处在初级阶段,主观意识过于浓厚的问题,已经超出了它的能力范围。 结合上述ChatGPT和文心一言的表现来看,AI想要取代人类员工还有较长的一段路需要走,互联网、新闻、设计等行业从业人员大规模失业的场景还不会发生。但人工智能最大的特点就是自我学习,目前AI大模型的一些“满口胡言”是局限于训练数据无法实时更新的弊端。一旦技术进步升级,解决掉现有问题之后,或许,以ChatGPT为代表的AI大模型会像比尔·盖茨认为的那样,其意义甚至超过PC、互联网的诞生,标志着一个全新时代的来临。 结语 文心一言与ChatGPT之间的差距真实存在,想让文心一言在短时间内完成追赶,几乎是不可能的事情。但毋庸置疑的是,文心一言的发布实现了中文语言大模型AI生成式产品从无到有的突破,对于中文互联网来说是个标志性的事件。 希望面向公众开放后,文心一言可以通过用户们大量的搜索请求进行学习、改进和升级,从而提升处理相应问题的准确性和速度。士别三日,当刮目相看,对于AI大模型来说更是如此。 本文属VRPinea原创稿件,转载请洽:brand@vrpinea.com
AI大模型时代的算力革命:ChatGPT引爆市场,氢能源蓄势待发
AI与地理

AI大模型时代的算力革命:ChatGPT引爆市场,氢能源蓄势待发

本文主要报道了三大股指全天冲高回落,北向资金全天净买入43.23亿元。在券商晨会上,多机构看好AI商业落地、绿氢发展和AIGC游戏应用前景。ChatGPT引爆大算力需求,氢能在能源体系中扮演重要角色,未来全球绿氢需求可达1.77亿吨。2023游戏开发者大会(GDC)于美国旧金山召开,AIGC技术在游戏制作、运营等方面有望得到广泛应用。
使用过ChatGPT后,我反而不担心自己的工作被它取代了
AI与数学

使用过ChatGPT后,我反而不担心自己的工作被它取代了

出品 | 搜狐科技 作者 | 潘琭玙 编辑 | 杨锦 两个月内,ChatGPT重构了人类对未来的想象。 今年2月,ChatGPT通过了平均薪酬为18.3万美元的谷歌L3软件工程师入职面试。有研究评估了ChatGPT在美国医学执照考试的表现,结果表明该模型可以与大学三年级的医学生相媲美。 一时间,ChatGPT引燃“人类工作是否被AI取代”的大讨论,创新工场创始人李开复也撰文谈论ChatGPT引发的失业恐慌,并列举了20项容易被AI取代的工作。 人工智能所能替代的人类工作已不止于重复性劳动,ChatGPT开创了以AI代替知识类工作者的可能性。它掌握了海量知识,可以轻松写出各类文章与程序代码,在某些方面的创意能力甚至超过人类。 苹果公司联合创始人史蒂夫·沃兹尼亚克认为,人工智能可以比人类更快地执行任务和做出决定,但仍缺乏人类独一无二的情感和品质。 但今年2月斯坦福大学学者发表的论文证明,原本被认为是人类独具的特质心智理论(ToM,Theory of Mind)已展现在ChatGPT背后的AI模型上,根据研究结果,GPT-3之后的AI模型同理心能力可能跟9岁小孩相当。 OpenAI CEO山姆·阿尔特曼也曾表示,“我们过去对于劳动难易的划分准则可能有问题,现在看来AI最先取代的可能是知识工作者和创意工作者的工作。” 但也有研究发现ChatGPT在逻辑推理、非文本推理和常识推理等10个不同的推理类别中平均准确率为64.33%,ChatGPT并非可靠。牛津大学计算机科学系的研究结果表明,ChatGPT的数学能力明显低于普通数学研究生。研究指出,ChatGPT通常能够理解问题但无法提供正确的解决方案。 “ChatGPT只是打开了一扇门,”资深人工智能研究专家田涛源在接受搜狐科技采访时表示。但在门后,个体对AI与人类关系的想象并无穷尽。搜狐科技对话了律师与心理咨询师,来听听他们如何看待个人职业与新技术的冲击。 “ChatGPT会降低我的效率” 当问及是否会有失业的危机感时,上海大邦律师事务所游云庭律师表示,在用过ChatGPT后反而没有危机感了。 他尝试使用ChatGPT生成一份游戏合同,在输入基本条件后,确实能够生成出一份符合标准的,最基础的合同。“但真实情况下的合同拟定更加复杂,也许未来能够取代20%至30%的工作量。” 他提到,很多大公司和银行耗费很高法务人力资源成本审查标准合同和处理较为简单的合同审查,这部分的服务需要智能,但对智能的要求又不高,同时沟通成本也比较低。“实际上大量的合同都是重复的,因为银行的合同就是金融合同,与用户签订。”他表示人工智能能够为律师承担这方面的工作。 有观点指出,ChatGPT提升了在垂类场景落地的预期。但田涛源指出,语言大模型LLM的数据处理成本高,另外获取文本需要大量的采购成本,还需要加上算力成本。“大模型的训练成本一次需要100万到500万美金。”此外,叠加后期运营成本,进入垂直领域仍需要进行大量优化。 游云庭律师也指出,ChatGPT向垂类领域扩展并实现减少律师服务成本之前,他目前所用的垂类付费工具例如法条检索,已能够满足需求,“ChatGPT反而会降低我的效率。” 谈及ChatGPT是否能够取代法律咨询的相关工作,游云庭律师表示,ChatGPT对于法律问题的回复,能够作为非法律行业需要了解标准化法律知识的人所用。 但面对一对一的咨询者,他指出,“我通过设置一系列的流程让他们讲清楚,很多人的能力不一定能够说清一件事情。”另外,他举例了进行商务法律服务的流程,即便面对面初步谈论所出现的争议,律师给到的初步判断也往往是不准确的。而针对AI是否能够实现追问与引导,田涛源表示,AI只会模仿人类的问题。 “或许患者更愿意向AI吐露心声” 而对心理咨询师Tim而言,ChatGPT已成为趁手的简单工具。 他向搜狐科技表示, 目前他在内容创作与心理科普方面,会利用ChatGPT帮助他进行头脑风暴。同时,在一些纸面工作例如输出咨询工作相关邮件模板,他已经将ChatGPT作为生活与工作中的简单工具。“只是其中的环节仍然需要人的整合再过滤,确认信息无误。当然它也可以为我提供一些不同的思路。” 在谈到对行业的帮助,他指出“ChatGPT可以让心理健康行业赛道更细分。”ChatGPT能够充分分担心理健康教育的工作,“它能够集合大量的通用信息。”但也因没有深入垂直领域,“专门的理论或者疗法相关的信息是达不到的。” 他认为,如果未来能够相对开源,通过培训语言模型囊括领域内的可靠信息来源,“我认为向更加细分领域发展后,它才能够成为一个更有利的工具。” 另一方面,Tim指出AI在心理咨询领域难以替代的是和真人建立的咨访关系。其中涉及对来访者的共情与理解,以及在特定的语境与文化环境中进行评估。而这一点,田涛源表示,人类目前无法定义意识。“脑科学和生命科学还有很长的路要去发展,把意识与自主意识说清楚是前提。” Tim也指出另一种可能性,若AI能够衍生出共情能力,“一些人在面对非真人时,或许更愿意对AI吐露心声。”据悉,目前心理领域已有应用AI对话机器人及数字化干预疗法,主要以CBT(Cognitive Behavioural Therapy 认知行为疗法)为范式,在足够的数据训练下,目前的AI自然语言处理水平基本可无障碍地实现一个合格CBT疗程,改变用户的认知及行为模式。 但这主要是由于CBT拥有高度结构化的特征,天然存在数字化的可能性。因此目前难以替代人,只能作为治疗的辅助工具。而Tim指出,AI若能够取代咨访关系,在非语言沟通的部分更加必要。“我们很多时候会根据来访者的手势、动作,他们的表情,这些属于评估中很重要的一部分。” 田涛源也提到,目前情感智能是人工智能前沿领域的分支研究方向。但是感知是多模态的,人工智能需要依赖大量的数据去做训练的。“认知层面的知识结构,也需要依靠大量心理学书籍的数字化数据。” ChatGPT本身并非拐点,预测学习模型已经存在了几十年。而将替代人类的论调,也是对ChatGPT的神化。田涛源指出,“严格来讲它不是技术取代人,而是使用新技术的这部分劳动者逐步与使用旧技术的劳动者竞争。” 他提出目前AI伦理层面的三个原则中,其一是“以人为本”。任何技术研发的最高优先级是服务好人类,“你一定要帮助人类,不管是提升体验还是效率。”在该原则下,技术的发展将遵循能否将技术控制在人类可控的范围内。因此,AI的发展以成为人类得力工具为大方向,“人使用新的工具实现商业模式创新,或者是效率升级,产业升级。” 但目前新技术尚未越过工业红线,田涛源指出,“就像是汽车火车跑的还没有人走的快。” 而人工智能正在处于一个大变革的前夜,因此我们需要给予技术正面价值的肯定。...