我的网站最新发布:厦门今天暑气蒸腾 明起迎来雨水 夏春:美国增加关税带来全球贸易碎片化,最坏损失相当于日德GDP之和 辽宁省工商联民营经济研究智库成立 佩洛西丈夫家中遇袭,被人用锤子打成颅骨骨折!凶手被判30年,原打算捆绑审问佩洛西 从环境卫生治理到全面社会健康管理——第36个爱国卫生月基层扫描 Beijing E-Town emerges as AI investment hotspot

绿灯侠

Kimi算力“熔断”!从卖不掉到算力紧缺,只隔了一年_我的网站

进击的巨人

A |     Token工厂第一客户不是人类!          作者/ IT时报 孙妍          编辑/ 郝俊慧          2026年的世界人工智能大会(WAIC 2026),若用一个词形容,那无疑是“热”——7月骄阳似火,算力基础设施赛道更是热度飙升。      中新社北京8月26日电 (记者 赵建华)中国工商银行、中国农业银行、中国银行、中国建设银行等多家银行近日相继发布公告,落实财政金融协同促内需一揽子政策(下称一揽子政策),激发民间投资,促进居民消费。         “去年WAIC我们愁的是卖不掉,今年供需反转了,算力不够、算力太贵、算力涨价。”PPIO联合创始人兼CEO姚欣对《IT时报》记者坦言。         一年之间,从“算力卖不掉”到“算力紧缺”。表面看,这是Token工厂的集体爆发。中国实施半年之久的一揽子政策,得以扩容。但水面之下,一场围绕智能体时代算力基础设施定价权与话语权的深层博弈,已在供需反转的大幕下悄然拉开。         WAIC 2026上,Token工厂模式不尽相同,却有着高度的共识:第一客户从人变成Agent。  年初,在中国国务院部署下,财政部牵头推出财政金融协同促内需的6项政策工具。政策设计紧扣“激发民间投资”和“促进居民消费”两个关键领域。一揽子政策实施半年之久,效果愈显。硬件见顶,软件是下一个10倍降本的主战场。  财政部公布的数据显示,1至7月,通过中小微企业贷款贴息、设备更新贷款贴息、民间投资专项担保计划、民企债券风险分担机制四项促投资的政策,服务业经营主体贷款贴息、个人消费贷款贴息两项促消费的政策,累计支持相关领域新发放信贷超20万亿元(人民币,下同)。

B | 四项促投资政策累计支持民间投资约1.51万亿元,两项促消费政策累计支持居民消费约1.88万亿元。  真金白银的一揽子政策,是财政金融“组合拳”。

C | 中国综合运用中小微企业贷款贴息等政策,构建多层次的融资支持体系,既降融资成本,又降融资门槛。

D |          Kimi算力“熔断” 算力供需大反转          7月17日,在WAIC 2026开幕当天,月之暗面发布新一代旗舰模型Kimi K3,在权威的Text Arena综合排行榜中,该模型以1486分位列第9名,成为首个进入全球前十的开源模型。         然而,发布48小时后,因用户请求量大幅超出预期并逼近集群承载极限,Kimi不得不在7月19日宣布暂停C端新用户订阅。“Kimi很好用,但是动不动就得订阅会员,用不起。

E |   在民营经济发达的浙江,一揽子政策实施短短数月,稳住了企业经营底气、提振了居民消费信心。”上游算力涨价潮已直接影响C端用户的选择。财政杠杆撬动庞大规模的金融“活水”,为扩大内需注入动力。         算力紧缺,是当前大模型行业的共性困境。

F | “计算需求在指数级攀升,今天,仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的鸿沟。

G | 相邻的江苏,实施国家政策的同时,统筹中央、省级、市县各级政策资金,鼓励各地因地制宜探索创新,形成可复制、可推广的经验做法。

H |   国家发改委国家信息中心经济预测部政策仿真实验室主任、研究员肖宏伟认为,一揽子政策是一场“财金联合作战”。通过整合贴息、担保、风险分担等多种工具,财政资金发挥引导和撬动的作用,金融机构积极跟进、放大投放。千亿级财政资金通过信贷担保、贴息激励等机制放大,可带动万亿级社会融资跟进,实现“四两拨千斤”的乘数效应。”无问芯穹联合创始人兼CEO夏立雪这样描述当前市场紧绷状态。  前期,超长期特别国债、消费品以旧换新补贴等已经为市场回暖奠定了需求基础,一揽子政策在此基础上强化金融配套,相当于“财政打底、金融加力”,形成叠加放大效应。         商汤大装置披露的数据也印证了这一趋势:其日均Token服务量已达2.42万亿,预计2026年全年服务规模实现25倍增长。

I |          供需反转背后有两个动因。AI应用从聊天交互向智能体任务进化,单智能体Token消耗可达传统对话应用的百倍至千倍级,正如中国工程院院士郑纬民指出的:“驱动智能体的Token正在成为新的‘石油’。一揽子政策实施期间,各部门联动协同发力,形成“财政+金融+产业”闭环。肖宏伟强调,财政部门出资金,金融部门保投放,产业部门列清单,确保资金流向设备更新、服务消费等重要领域。

J | 特别是,用好民间投资专项担保和债券风险分担机制,真正破解民营企业融资难题。  一揽子政策效果已现,官方寄望颇多。”          姚欣观察到,企业内部大量重复性劳动正在被AI改造,而使用最积极的不是技术人员,而是财务、人事、行政、市场这类非技术岗位。与此同时,OPC(一人公司)正在涌现,它们的Token月消耗量可达百亿级别,这一量级以前只有大型企业才能达到,而且OPC公司的人类员工与AI员工比例可以达到1:10,甚至1:20。

K | 中国财政部、中国人民银行、国家金融监管总局三部门近日公布最新的财政金融协同促内需政策:扩大贴息范围,增加经办机构,提高额度上限。         第一客户从人变成智能体          “云的第一客户从人变成了Agent(智能体)。”姚欣的这一判断,在WAIC 2026上获得了来自产学研各界的呼应。市场寄望颇厚。  一揽子政策扩容后,北京国家会计学院副院长李旭红表示,包括一揽子政策在内,更加积极的财政政策要注重精准性、有效性和可持续性;既要关注政策是否贴近企业和居民的实际需求,支持中小微企业、民间投资和服务业经营主体,又要通过消费贷款贴息等政策提升居民消费能力,令促内需政策更好传导至县域和基层;最终,促进消费与投资形成良性供需循环。中国信通院云计算与数字化研究所副所长栗蔚给出了一个新的定义——Agentic Cloud:以云计算资源为基础底座、大模型能力为核心驱动、智能体服务为基本单元,具备理解用户意图并自主完成复杂任务能力的新一代云计算服务体系,“正在成为未来主要云服务模式”。         云服务正从“降本”转向“增值”,交付的不再只是低成本算力资源,而是承载智能与能力的新模态服务。PPIO升级为Agentic Cloud,商汤大装置进化为“算力+平台+服务”全栈AI基础设施服务商,无问芯穹延伸至“前店后厂一中心”。三家的演进方向,都是从单点的算力基础设施走向融合运行环境、任务编排和应用的服务体系,目标都是要打造面向Agent时代的Token工厂。

L |          正因客户主体发生转变,智能体的消费模式与人类存在本质差异。姚欣将其概括为“脉冲式使用”:人在使用虚拟机时,开启后往往连续运行数月不关机;而Agent调用沙箱时,完成任务即停止,一台虚拟机的单次使用时长可能仅1分钟便会关闭。这种模式对时延和并发的要求远高于传统场景。

M |          对此场景,PPIO的应对措施是通过Harness手段托管Agent,实现7x24小时长时间运行,并且可以自我修复;无问芯穹用智能体能力反哺基础设施自身,打造运维智能体蜂群,以Agent能力驱动整套AI Infra形成自主迭代、自我优化的闭环。         硬件见顶 软件是下一个10倍降本的主战场          共识正在形成:GPU硬件的性能提升正在触达物理天花板,未来Token成本的下降将越来越依赖软件层面的系统级优化。

N |          姚欣的分析最为直白:“GPU芯片已经到了物理极限,现在用的是3nm制程,2nm应该就到顶了,根据相关技术数据,2nm工艺相比3nm制程仅能实现约20%的晶体管密度提升、15%左右的性能提升,晶体管密度最多提升1.15倍,已经没有再提升10倍的能力了。

o | ”          他将未来成本下降的希望寄托于软件:“每隔12个月,智能体的使用成本就会下降至十分之一,软件的增长空间极其巨大。”          他还指出,推理侧最大的成本变量已经从GPU转向了存储。因为Agent追求长期记忆,上下文已经扩展到百万级,“100万KB的上下文要全部保存下来,只能先放显存,然后是内存,最后再到硬盘,由此直接推高了存储成本”。         降本,是所有使用者的诉求,必然也是所有Token工厂的核心思路。商汤大装置通过异构混推技术提升国产算力性价比,相比国产同构推理,异构混推集群实现同成本Token产出规模扩大2.5倍;无问芯穹在过去一年通过全栈技术实现推理成本下降10倍,并预期跨集群异构PD分离架构的规模化落地,还能再带来10倍下降空间。摩尔线程通过异构流水线组合,在硬件规格仅为国际主流产品一半的情况下,达到同等的推理水平。         Token工厂 不同的战略锚点          在WAIC 2026上,PPIO、商汤、无问芯穹、摩尔线程等多家Token工厂都抛出了战略之锚。         全栈优化派PPIO          姚欣将黄仁勋的五层蛋糕模型(能源—芯片—基础设施—模型—应用)作为参照,指出PPIO从第二层到第五层全部涉及。

p |          “今天不仅仅要看Token生产的数量有多少,更要看Token的智能和毛利率,所以一定要做端到端的全栈式优化。

q | ”姚欣强调,目前国内真正能够做到全栈优化的厂商仍极其稀缺。         基于这一逻辑,PPIO推出的核心利器是智能模型网关。智能模型网关是AI Agent的智能调度中心,关键决策由混合模型把控以提升质量,简单任务则通过模型调度自动分流至轻量模型,确保Agent以最低Token成本、最优智能性能完成任务。当用户提出法律合同审查、医疗初步诊断等需求时,网关会将问题同时分发给多个擅长此道的专家模型,通过交叉验证和融合生成最终答案。         PPIO的混合模型可以将性能提升至接近Claude Fable5的水平,而成本却大幅降低。据综合测算,智能模型网关可以将智能水平提升20%,将成本降低50%~60%。         商汤大装置的国产化叙事          Token工厂叙事,则嵌在一条更大的国产化替代主线下。         商汤科技联合创始人、大装置事业群总裁杨帆判断:“未来五年国产化替代绝不仅仅是GPU的替代,而是背后整个AI基础设施生态体系的重构。”          摩根士丹利预测,最乐观的市场情景下,中国AI芯片自给率有望在2030年达到76%。         在国产芯片突围的背景下,商汤大装置的核心突破是异构混合推理。商汤大装置事业群CTO宣善明披露,通过异构混推,主流国产芯片MFU提升85%至152%,整体推理性价比达到NVIDIA H系列的1.25倍。在能效方面,商汤大装置提出了TPW(Tokens Per Watt)指标,将电力消耗与Token产出直接挂钩,替代传统的PUE能效指标。据商汤大装置数据,通过端到端全链路优化,单位电力成本Token产出已提升80%。

r |          在产业落地的“最后一公里”,商汤大装置与电信运营商殊途同归,以FDE(前沿部署专家)模式交付结果。在先进制造领域,商汤大装置已服务5家上海大型国企,并总结出“1天明确业务价值、2天完成Demo验证、30天实现稳定版本上线”的AI“123”交付法则。         无问芯穹 “前店后厂一中心”          无问芯穹将Agentic Infra打造为“前店后厂一中心”:算力集散中心(自主式基础设施平台)、Token工厂(MaaS平台)、AI生产力商店(行业解决方案)。         它想通过全局资源一盘棋调度,实现十万卡级别以上的跨域计算资源支撑规模。

s | 无问芯穹的核心技术壁垒之一在于异构算力聚合,“算力的异质化、碎片化问题是全球性的,如何把不同的、跨区域的算力资源,高效聚合协同起来,是扩大智能资源规模的关键。”夏立雪认为。         无问芯穹联合中国电信完成国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升165%。同时,它还打通4个不同代际、不同型号的GPU集群,四集群协同性能提升41%。目前这套跨域训练系统已在全国部署触达超37000P算力、覆盖16种主流芯片,盘活了广域分散的异质算力。

t |          在Token工厂层面,无问芯穹于2026世界人工智能大会发布了首创的新一代推理系统优化成果——跨集群异构PD分离架构(PDD),相当于让“偏科”的硬件只刷自己最擅长的题,实测显示该架构在实现首Token延迟降低51.5%的同时,单Token成本降低37.5%。         摩尔线程 从“芯”出发          与前三家从云服务或基础设施层切入不同,摩尔线程从芯片出发,提出了三大“AI工厂”的框架:模型训练工厂、词元生产工厂、智能体生产工厂。         摩尔线程创始人、董事长兼首席执行官张建中强调“全功能GPU”的概念,不仅能做训练和推理,还具备光线追踪和图形渲染能力,并称摩尔线程S5000是国内唯一具备光线追踪能力的智算芯片。

u |          在Token生产工厂方面,摩尔线程的核心卖点是基于S5000的PD分离异构推理方案:将高算力需求的Prefill放在S5000上,将高带宽的Decode放在国际主流GPU上,相比于单独部署国际主流GPU同构方案,性价比优势显著。         从“种草”到“种树” 转化效率之争          当所有玩家都在谈论Token产能时,生产出Token还不是终点,将Token高效转化为产业生产力才是终局。

v |          郑纬民表示:“Token与Token并不等值,如火如荼的算力基建也不等同于高效Token产能。”夏立雪提出的AI生产力公式或许是对这一趋势最凝练的概括:“AI生产力=智能资源规模×Token转化效率×AI生产力转化效率。”          行业正在从概念“种草”阶段进入实质“种树”阶段。PPIO的日均Token调用量超1.2万亿,商汤大装置的日均Token服务量已达2.42万亿,预计到2026年底将攀升至日均10万亿,全年实现25倍增长;无问芯穹半年增长曲线是40倍……这些不再是对未来的预测,而是已经发生的数字。

w | 但算力的终局不会是比谁能生产最多的Token,而是跑通从算力生产到价值落地的闭环。         Token使用者吐槽算力价格太贵,Token小厂坦承上游存储太贵,又面临国内Token市场面临大厂恶性价格战,毛利率接近负100%。         正如商汤大装置杨帆所言,人工智能企业如何实现持续的规模化盈利,“不仅是商汤的课题,也是当下众多大模型企业、AI应用企业所有人共同的课题”。         排版/ 季嘉颖          图片/ IT时报 采访对象          来源/《IT时报》公众号vittimes。

Current article:http://www.zhanggengsenchaiweikeng.cfd/p5hto/tyjp.html

Published on:13:11:01


上一篇:Kimi算力“熔断”!从卖不掉到算力紧缺,只隔了一年 下一篇:2022年中国农民丰收节金秋消费季在京启动

我的网站相关阅读