3868la银河总站官网

来源:老手整理 ,作者: 达人计划 ,:

一家人一台车:广汽与华为乾崑如何“跨界融合”造出启境GT7

脱手超10个亿 ,成都匹俦扩编调料帝国

内容来源:条记侠 ( Notesman ) 。责编? | ? 柒 ?排版? | 沐言第 9677篇深度好文:6983| 15 分钟阅读商业思维条记君说:智谱 ,赌对了 。就在昨天 ,智谱正式宣布并开源了新一代旗舰模型 GLM-5.2 ,股价大涨 ,截止到今天收盘 ,市值达 9336 亿港元 。这款主攻"长程任务"的模型 ,让 AI 从"即时问答"跨越到"像人一样连续事情数小时" 。在全球百万用户盲测的 Code Arena 上 ,GLM-5.2 拿下全球可用模型第一 。不但如此 ,在编程能力上 ,GLM-5.2 的"使用体感" ,已经和 Opus 级模型基本没有差别 。这不是突然的爆发 ,而是一场近十年的长跑 。从 2016 年在清华实验室界说"认知智能" ,到 2022 年孤注一掷训练千亿模型 ,再到如今成为"全球大模型第一股" ,张鹏和他的团队 ,始终在赌一个目标:AGI(通用人工智能 ,指能够在险些任何领域像人类一样完成智力任务的人工智能 ,是许多 AI 公司的终极目标) 。今年年初 ,张小珺对智谱 CEO 张鹏进行了一场对谈 ,谈到了他从科学家到创颐魅者的十年心路 。以下为访谈精编内容整理版 ,希望对你有所资助 。一、从实验室到工业化1.2016 年:认知智能的起点我的履历很是简单 ,从 98 年进清华就没离开过 ,结业以后在清华大学盘算机系知识工程实验室事情 ,一直做人工智能相关的事情 。2015、16 年 ,到了一个很要害的节点 。我们看到上一代 AI 企业很是乐成 ,但也面临一些问题 。那时候各人关于未来 AI 技术的演进看得更远 ,会觉得像 CV ( 盘算机视觉)、早期的 NLP(自然语言处理)和机械学习这些要领 ,天花板可能就在这了 ,做不到理想中的通用人工智能 。所以 ,那时候逐渐有了一点想法:我们要去做下一代人工智能 。结论就是爆发了一个词 ,叫认知智能(指在感知智能基础上具备理解、推理、计划等高级认知能力的下一代人工智能) 。我们认为认知智能是感知智能的下一代 ,是迈向通用人工智能的下一个台阶 。它并不等同于 AGI ,但如果是下一步 ,我可以实验去界说它 。16 年已经在考虑创业 ,真正开始行动是 17 年 ,实验在学校体制下把商业化转化路径走通 。契机是 18 年 ,国家几个部委联合给了一个意见 ,允许科研院所在职人员用已有的研究结果做科技结果转化 。2. 早期商业化:科技情报与认知能力我们一开始就做科技情报这件事 ,情报学实质上就是认知能力的一种应用 ?萍祭嘈畔⑾喽怨娣 ,论文、科技报告、专利都有规范性花样 ,描述严谨 ,有数据 。算法是我们擅长的 ,我们就建立起一个模型来交付 。古板做法是靠专家 ,大宗调研问卷、阅读文献、写报告 ,靠专家经验去解决问题 。我们是用机械学习算法、用模型来解决问题 。效率和处理数据的速度完全纷歧样 。至公司找我们做技术预测 ,问题很简单:未来 3 到 5 年 ,在某个领域里哪些技术会成为热点?预测这种事 ,一定是要基于认知的 。我们其时那个平台叫 Aminer ,在国际上影响力不错 ,并且我们专门做这一块 。所以其时出来创业 ,实质上是在做背后焦点的技术 ,怎么用数据、机械学习算法去构建模型 。它跟现在大模型解决的问题很是类似 ,只是用了上一代的机械学习要领 。那时候也挣钱 ,但肯定照旧亏着的 ?萍冀峁瓿珊 ,第一笔天使投资很快就拿到了 。我们跟投资人讲的逻辑很清晰:第一 ,我们要做认知智能 ,做下一代 AI 技术;第二 ,在这个基础上我们找到了场景 ,有产品宁静台 ,有不错的用户基础和市场基础 ,已经在学校效劳了许多客户 。二、技术路线转折1.GPT-3 宣布 ,请张钹院士来座谈19 年公司建立时 ,我们已经在做机械学习算法的研究 。像 BERT(Google 在 2018 年提出的预训练语言模型 ,接纳双向注意力机制 ,擅长理解上下文 ,通常被形容为 " 完形填空 " 式模型)这类大模型上一代的工具 ,一直在用、在研究 ,所以很早就关注到 GPT 。GPT-1 是 18 年 ,GPT-2 是 19 年 ,已经在学术界有影响 。2020 年 GPT-3 宣布 ,是个分水岭 。正好公司一周年 ,我们请张钹(中国科学院院士、盘算机应用专家)来座谈 。我其时关注着最新研究进展 ,就提出来说 GPT-3 很火 ,想听听张院士怎么看 。他评价很是高 ,嗣魅这是机械学习里程碑式的进步 ,有一种新的范式 。但他也担心一个问题:GPT 照旧不知道自己不知道 。那个时候 ,各人也开玩笑说 GPT-3 会一本正经地乱说八道 。所以 ,从那时起 ,我们开始重点研究这个偏向 。2.GLM 的降生:综合 BERT 和 GPT我们就研究 GPT 自回归预训练和 BERT 究竟有什么区别 。GLM 算法(通用语言模型 ,智谱自研的模型架构)在 21 年相对成熟 ,做了一年 。那时候业内并没有高度统一认为 GPT 路线就是唯一正确的 ,各人还在想有没有步伐走出新的立异 。GLM 就是在 BERT 和 GPT 之间 ,想综合两种算法优势 。BERT 是双向注意力 ,称为填空机械人;GPT 是单向的 ,只看前面预测下一个 ,称为蹦词器 。GLM 综合的方法很巧妙 ,把问题统一了 ,把双神往中间预测的词的顺序调一下 ,实际上就酿成了单神往后预测 ,既保存了双向注意力的优势 ,也融合了单向预测能力 。所以 GLM 出来时 ,既能做填空题 ,也能做续写预测 。并且由于接纳了部分双向注意力 ,训练历程中稳定性更好 。三、要害赌注:训练千亿模型1. 要不要投千万训练模型22 年 ,我们开始决策要不要像 GPT-3 一样做千亿模型 。那时候 Scaling(规模定律 ,描述模型性能随参数量、数据量和盘算量增加而泛起出可预测提升的现象 ,后扩展到推理时盘算、强化学习等维度)很简单 ,参数量翻倍、翻十倍 ,智能水平就上去了 。GPT-3 训练本钱 2000 多万美元 ,我们自己做预计也得千万级人民币以上 。要不要做?慎重考虑之后 ,结论是:应该做 ,必须自己做 ?蒲Ъ彝哦悠鹆撕茏攀鲇 ,GLM 的研究积累让我们有信心能把模型训练出来 ,性能不会差 ,不会让钱吊水漂 。从 21 年 12 月底开始 ,泰半年时间 ,到 22 年七八月份弄完 ,或许 9 个月 。那时候开始跟投资人聊 ,讲我们训练了一个对标 GPT-3 的模型 ,性能不错 ,还开源了 。投资人听不懂 ,完全听不懂 。" 这什么工具?怎么挣钱?怎么商业化?" 甚至有个投资人线上聊 ,说大情况这么差 ,要不你们把估值降一半?但我们肯定不会啊 。那个时间其实挺艰难 。2.ChatGPT 时刻:浪潮来临22 年 11 月 ChatGPT 上线后 ,一下子火起来了 。ChatGPT 火起来后 ,各人也不必质疑我们在做什么了 。我们就说 ,你看 ChatGPT 知道吧?我们做的就是往这个偏向去的 。厥后 ,投资人就主动找过来了 。我们自己很快也把对标 ChatGPT 的 ChatGLM 弄出来上线 ,尤其在中文上效果很是好 ;雇笨戳艘桓鲂〉 6B 版本 ,60 亿参数 ,一张家用 GPU 就能跑起来 ,那是我们第一款在开源社区爆火的项目 ,下载量很是大 。那时候 OpenAI 还比较开放 ,许多工具发论文 ,厥后论文少了 ,但 technical report 和 blog 还会慢慢放出来 。我们紧随着研究 。再加上清华学生在那边许多 ,底下的交流很是顺畅 ,我们知道他们在连续做事情、往哪个偏向走 。所以 ChatGPT 出来 ,至少我个人照旧挺兴奋的 。觉得赌对了 ,第一赌对了 ,第二说明这条路走下去 ,是有很灼烁的前景的 。3. 百模大战:兴奋与焦虑23 年一转年 ,浪就来了 。最深的印象就是那三个字:百模大战 。圈内圈外全进来了 ,许多熟识的人都站到了这个赛道上 。我的感受是两个 。第一个是兴奋 ,这个事迎来了巨大的时机和浪潮 ,不必再教育市场和投资人了 。第二个 ,说实话 ,我个人照旧有些焦虑和担心 。因为每逢大浪过来 ,再往后看 ,可能就是一地狼藉 ,最后留不下什么 。我怕的是整个市场从一个极端走向另一个极端 ,塌掉之后很难再回来 。市场都没了 ,你做得再好也没用 。我们看到太多这种事 ,大宗的资本和人进来 ,但各人区分不清谁说的是对的、更接近真相 ,谁是在吹故事、吹泡泡 。23 年最大的挑战 ,就是怎么在纷骚动扰的商业化市场中 ,包管技术快速迭代 ,同时找到自己的路 ;旧 23 年我们把商业化的架子搭起来了—— MaaS(模型即效劳 ,一种将 AI 模型作为效劳交付的商业化形态 ,包括云 API 挪用、外地化安排、软硬一体产品等多种模式)有了 ,to B 企业效劳有了 ,开源有了 ,研究进展也有了 ,GLM2、GLM3 宣布很紧密 。四、商业化路径:MaaS、toB 与 toC 的取舍1.MaaS 的提出千亿模型训练完之后 ,我们就在想商业化路径究竟怎么走 。MaaS(模型即效劳)这个看法是我们最早提的 ,那时候我们界说的 MaaS 比现在大部分人理解的规模要广 。现在各人说 MaaS 都是指云 API ,但我们其时说的形态更富厚:除了云上 API ,另有外地化安排 ,把模型看成随意可安排的组件;另有软硬件结合、可以随时拎到哪的产品 。怎么收缩成云 API 了呢?我觉得云厂商功不可没 ,他们想往这个偏向引 ,因为这是他们的主战场 。2. 为什么没有全力做 toC?其时剖析 ,如果直接照搬 ChatGPT 或 OpenAI 那套模式到海内 ,除非你能抢到巨大的首发市场优势 ,不然很难 。在那个群雄盘据、混战的局面下 ,最后一定陷入倒贴、引流、补贴、让用户白薅羊毛的状态 。中国 C 端市场的付费意愿照旧太差 。我们厥后做了智谱清言 APP ,也投过流 。我们把它定位效果率工具 ,看用户使用曲线很有意思 ,跟上班上学的时间完全重叠 。早上 8 点到中午 12 点 ,下午 1 点到五六点 ,晚上很少 。算完 ROI 之后 ,这是很不对算的一件事 。3.toB 简直定性更高toB 这件事 ,确定性其实更高 。故事可能没那么性感 ,账没那么好算 ,但相比照较 stable(稳定) 。中国 SaaS 起不来有它的特殊性 ,有人跟我讲过一句话:我花同样的钱 ,买订阅一个月 10 万块 ,还不如用 10 万块雇 10 个人帮我把活干了 。这实质照旧本钱问题 。但 toB 有溢价空间 。我们是做这个技术的 ,对技术自己的理解更深 。别人也能做类似的事 ,但可能需要更高本钱 。我们可能只需要更少的人、更短的周期 ,就能抵达更好的效果 。这就是我们的溢价空间 。五、坚持走开源路线1. 一直坚持走开源路线我们基本上没有摇摆过 ,一直坚持开源 。所有要害模型迭代和技术更新 ,都有相应的开源版本或开源项目 。早期我们把开源和商业化分得很清楚:开源是把焦点技术放出去 ,让各人能用、了解细节 ,在此基础上去做自己的立异探索;商业化是面向客户的 ,提供的不是开源那堆参数文件 ,而是基于这些工具的一系列产品、工具和效劳 。2.DeepSeek 彻底开源带来的攻击DeepSeek 彻底开源后 ,各人可以基于他的研究结果去做许多事情 。对我们商业化市场的影响是 ,许多客户脑子里把开源和免费划等号了 。他会问:你都开源了、不要钱了 ,为什么还收我钱?那怎么办?只能用时间来证明 。许多客户自己去实验安排 ,有的找外面团队资助 。但过了一段时间 ,你会发明大部分人掉头回来了 。为什么?因为 DeepSeek 也不提供商业化效劳 。就算你安排了 ,也没有步伐跟内部系统做整合 ,这需要很专业的效劳和人来干 。对不起 ,原厂也不提供这个效劳 。当各人想通商艺的焦点锚点是什么的时候 ,自然会回来找你 。3. 开源加速了智力平权开源可能加速了整个智力平权的历程 ,技术不可能只掌握在少少数公司或个人手里 。中国厂商各人都开源 ,其实给世界提供了更多选择 。就算没有开源 ,最终结局可能也是美国走一条路 ,商业公司捏着顶尖闭源模型来推动资本积累运转 ,全球其他玩家去寻找第二、第三甚至更多选择 。中国的战略 ,肯定不会放弃这个路径 。4.DeepSeek 带来的反思DeepSeek 对我们的影响照旧比较大的 。不管研究、工程照旧市场层面 ,我们都仔仔细细内部研讨过 。也算反思 ,确实给了许多启示和提醒 ,学到许多工具 。结论是 ,应该更开放地看待大模型的研究和市场 。这些因素都搅在一起 ,很难完全理清楚或离开开 。需要

热门排行

网站地图