让建站和SEO变得简单

让不懂建站的用户快速建站,让会建站的提高建站效率!

24
2026
07

0.35好意思元vs 5好意思元,硅谷巨头的Token价钱战!不仅“卷”价钱,还在拼推理速率

发布日期:2026-07-24 08:52    点击次数:103

  每经记者 文巧    每经剪辑 兰素英    

图片起原:视觉中国图片起原:视觉中国

  5月以来,国内大模子打响了“价钱战”。从每百万个Token唯有1块钱,到唯有8毛钱、5毛钱……国内大厂如字节跨越、阿里、百度、智谱AI、科大讯飞等不休勤苦,有厂商致使径直打出了“免费”的标语,震恐扫数科技圈子。

  本色上,硅谷也在献艺着一样的情形。《逐日经济新闻》记者谛视到,硅谷大模子的价钱也出现了下落趋势。

  API价钱战早先在OpenAI和谷歌这对“老敌手”之间张开,不外幅度相对较小。其中,OpenAI的GPT-4o调用API的价钱比GPT-4-turbo诽谤了一半,为5好意思元/百万Tokens,谷歌Gemini 1.5 Flash的价钱降到了0.35好意思元/百万Tokens。

  到底是什么在阁下API“价钱战”?在降价以外,有媒体指出,加速模子推理速率(即每秒生成Token的数目)亦然硅谷大模子商场的主要竞争点。但“卷”价钱、“卷”速率果真会获取改日吗?

  硅谷在“拼”什么?

  5月中旬,字节跨越豆包以0.0008元/千Tokens的价钱径直将国内大模子的商场价钱带入“厘时间”。立时,大模子厂商便运行了价钱上的角力。百度致使径直祭出“文心大模子两大主力模子全面免费”的大招,径直将“价钱战”推向新的高度。科大讯飞、腾讯等也“坐不住”了,要么降价,要么免费。

  短短数天,国内大模子企业的混战便从“廉价”走向了“免费”。而在硅谷,一样的情形其实也在献艺。

  《逐日经济新闻》记者谛视到,本色上,诽谤API价钱和推升AI推理速率也已冉冉成为硅谷各大模子提供商的竞争焦点。

  API价钱战早先是在OpenAI和谷歌这对“老敌手”之间张开的。当地时刻5月13日,OpenAI发布全新模子GPT-4o,该模子赈济免费试用,据传改日将供用户免费试用。此外,调用GPT-4o API的价钱比GPT-4-turbo诽谤了一半,为5好意思元/百万Tokens。

  在第二天的谷歌环球斥地者大会上,谷歌秘书方丈王牌Gemini大模子系列之一Gemini 1.5 Flash 的API价钱为0.35好意思元/百万Tokens,远低于GPT-4o的价钱。

  比GPT-4o更具性价比的还有硅谷当红AI初创公司Anthropic和Mistral AI模子的API价钱。 

图片起原:每经制图图片起原:每经制图

  除了“拼”模子调用价钱,有媒体指出,硅谷AI芯片公司正以加速模子推理速率——即每秒生成Token的数目——以蛊卦客户。举例,好意思国芯片厂商Groq公司专注于提高每秒生成Token的数目,以此算作其主要的商场竞争点。

  据科技外媒Medium本年4月的报说念,Groq最新的AI芯片在Meta的开源模子LLaMA 3上达到了惊东说念主的每秒生成800个token,并称这“符号着AI推理后果和能力的宽绰滚动”。扬弃现在,英伟达一直主导着AI芯片商场。该报说念分析以为,Groq的最新建树可能将对英伟达的总揽地位组成严峻挑战。

  根据Groq的数据,好多开源模子据称在Groq芯片上的运行速率皆得到援助,举例,Mixtral8×7B版块每秒输出500个Token;Llama 2 70B版块每秒输出300个Token。

  《逐日经济新闻》记者查询数据发现,面前配备英伟达芯片贬责的硅谷热点大模子推理速率远低于此。举例,GPT-4 Turbo每秒生成约48个token,GPT-4为每秒约10个token;谷歌的Gemini 1.5 Pro约为每秒54.2个token。 

图片起原:每经制图图片起原:每经制图

  API“价钱战”背后:模子性能差距正在减小

  硅谷为何也会濒临大模子的API“价钱战”问题?这主若是跟模子的性能相干。

  上个月,纽约大学有名陶冶Gary Marcus发表了一篇名为《凭据标明LLM正达到收益递减点》的著作,辩驳了宾夕法尼亚大学沃顿商学院陶冶Ethan Mollick的一个不雅点,后者宣称现在对大型说话模子改良率的最好推测涌现,能力每5~14个月翻一番。

  Gary Marcus以为,从某些方针来看,在2020~2023年间,大模子的能力确凿解任上述定律翻了一番,但在往常13个月里这种情况并未发生。“相背,我看到好多迹象标明咱们照旧插足了收益递减期。”他这么写说念。

  若以MMLU(一种常见的大模子基准方针)为基准,不错看到,从GPT-2到GPT3再到GPT-4呈现了飞跃式的递加,但GPT-4到本年4月发布的GPT-4 Turbo的能力改良并不显着。

图片起原:《凭据标明LLM正达到收益递减点》图片起原:《凭据标明LLM正达到收益递减点》

  其次,自GPT-4发布以来,硅谷各大模子的能力正在趋同。LiquidAI的机器学习科学家Maxime Labonne在X平台上暗示,施展最好的闭源模子(GPT-4级别)和开源模子在性能上的差距正在越来越小。

图片起原:X平台图片起原:X平台

  与此同期,跟着企业对定制化大模子的需求越来越高,硅谷科技公司正在推出一系列小模子,举例微软在4月推出了名为Phi-3 Mini的轻量级模子。The Information分析称,像Phi这类袖珍模子的激增可能会减轻OpenAI的主导地位。

  据The Information,微软居品团队照旧将内置的GPT-4换成开源模子,以在Bing等居品中试验更基本的任务。而领先为 OpenAI大模子支付高价的一些公司,近期运行转向包括开源模子在内的更低廉的竞争敌手。

  跟着GPT-4之后模子能力的趋同,以及更多开源模子和小模子的出现,竞争加重之下,高价大模子的降价似乎是一种例必。

  “卷”价钱、“卷”速率并非非常

  然则,一味“卷”价钱会有改日吗?

  家喻户晓,算力资本是斥地大模子无法绕过的难点之一。根据斯坦福大学HAI筹划所本年发布的AI讲明,检会巨型模子的资本呈指数级增长,谷歌Gemini Ultra的检会资本推测为1.91亿好意思元,GPT-4的检会资本推测为7800万好意思元。

  据报说念,Anthropic的CEO此前曾暗示,现在正在检会的模子资本已接近10亿好意思元,到2025年和2026年,将飙升至50亿或100亿好意思元。

  科技巨头照旧在硅谷大模子规模树立稳健的藏身点,前沿基础模子商场呈现出浓烈的商场齐集化趋势。分析以为,价钱战抓续下去,公司利润例必被挤压,财力浑厚的科技巨头尚有基础,但初创公司则可能濒临风险。

  关于大模子公司来说,援助模子性能才是获取竞争的最终工夫。正如Gary Marcus所讲,如果收益递减的趋势抓续,初级装假无法修正,大模子可能耐久无法到达黄金时段。

  另一方面,关于芯片厂商来说,“卷”每秒生成Token的数目仍然更多仅仅一种噱头,镌汰第一个Token生成的时刻或将成为下一个新的竞争点。

  尽管Medium分析以为,每秒生成Token数目的提高档同于推理能力的飞腾,但硅谷AI公司SambaNova在5月初发表的一篇博客著作中暗示,当触及到一些较为复杂和发愤的长文本任务时,每秒生成Token数目并非最弥留的方针,也不可全面反馈大模子的推感性能。而相对地,第一个Token生成的时刻才愈加弥留。

  这篇著作直白地指出,对每秒高Token数目的追求可能是一种“炒作”。尽管其照实不错达成令东说念主印象深切的解码速率,但存在芯片操纵率低,第一个Token生成速率较慢,难以贬责较长的文本输入等紧要过错。

股市回暖,抄底炒股先开户!智能定投、要求单、个股雷达……送给你>> 海量资讯、精确解读,尽在新浪财经APP

职守剪辑:欧阳名军



相关资讯
热点资讯


Powered by 广州市居首职业技能培训有限公司 @2013-2022 RSS地图 HTML地图

Copyright Powered by365站群 © 2013-2021 365建站器 版权所有