
A | 智东西(公众号:zhidxcom) 作者 | 程茜 编辑 | 云鹏 智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。 AI摘要 8月19日,漳州市长魏东主持召开市政府党组(扩大)会议暨常务会议,学习贯彻习近平总书记重要讲话精神,部署推进安全生产整治、生态环境保护及人工智能赋能发展等重点工作。 榜单中SOL得分指的是GPU的峰值算力与HBM带宽共同决定的理论性能极限。模型这一分数越接近1,代表其生成和优化GPU算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。 这一榜单中排名第二的是腾讯混元Hyra、排名第四的是人类开发者Amir M. Mir、排名第六的是美国AI创企doubleAI的全自动GPU内核生成智能体系统、排名第十的是AI编程独角兽Cursor,其他项目暂未找到公开打榜记录。 SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。 7月19日,阿里千问大模型团队宣布将很快发布并开源Qwen3.8。 8月19日,漳州市政府党组书记、市长魏东主持召开市政府第十五次党组(扩大)会议、第十五次常务会议,认真学习习近平总书记近期重要讲话重要指示精神,按照市委部署要求,研究贯彻落实措施;听取全市安全生产工作情况以及隐患大排查大整治攻坚任务推进情况汇报,研究推进全市主要流域国省控断面水质、空气质量提升以及平和县花山溪饮用水水源地风险突出问题整改工作。该模型参数2.4T,可能是除了Fable 5外最强大的模型。 会议强调,要深入学习贯彻习近平总书记在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上的重要讲话精神,深入实施“人工智能+”行动,用好政务服务人工智能体“候喜”、“城市大脑”平台,推动人工智能赋能千行百业。

B | 昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表现更好。 一、从124个模型中提取,共235项CUDA内核优化任务 随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。要深入学习贯彻习近平总书记对基础教育工作作出的重要指示精神,全面贯彻党的教育方针,坚持不懈用党的创新理论铸魂育人,优化教育资源配置,促进学生全面发展,推进基础教育高质量发展。要深入学习贯彻习近平总书记关于侨务工作的重要论述,打好新时代新“侨牌”,充分发挥漳州人才联合会作用,进一步凝侨心、引侨资、汇侨智、聚侨力,奋力书写新时代侨务工作新篇章。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。要深入学习贯彻习近平总书记在7月30日中央政治局会议、党外人士座谈会上的重要讲话精神,全力以赴拼经济、抓发展、惠民生,持之以恒推进全面从严治党,发挥党外人士在凝聚共识、建言资政、服务大局上的独特优势,不断加快现代化滨海城市建设步伐。 基于此,英伟达提出了SOL-ExecBench基准套件。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。要深入贯彻习近平强军思想,认真学习贯彻习近平总书记在中央政治局第二十七次集体学习时的重要讲话精神,扎实做好新时代双拥工作,全力服务国防和军队现代化建设,为推动强国强军事业贡献更多漳州力量。 与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。 会议强调,要深入学习贯彻习近平总书记关于安全生产的重要论述,时刻绷紧安全生产这根弦,深入开展安全生产隐患大排查大整治,扎实推进劳动密集型企业火灾隐患整治首批五项重点攻坚任务落实落细,严格“检查—交办—整改—复核—销号”全链条管理,动真碰硬执法监管,坚决维护人民群众生命财产安全和社会大局稳定。 会议强调,要深入学习贯彻习近平生态文明思想,严格落实“党政同责、一岗双责”和“三管三必须”要求,牢牢守住生态环境保护底线,盯紧抓牢中央、省生态环境保护督察反馈问题整改,坚决打赢水质提升攻坚战,全力推动空气质量回升向好,扎实抓好花山溪饮用水水源地风险突出问题整改,促进生态环境质量稳步提升向好。 会议还研究了其他事项。

C | 其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限。

D | 英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。

E | 具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。(漳州融媒记者 廖瑜婷)。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。 为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。 此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。 该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。 该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。 根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。 二、榜单排名靠前,意味模型具备闭环自我改进潜力 Kernel优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一: 反馈明确:运行时间、吞吐量、带宽利用率可以精确测量; 标准客观:距离硬件理论极限还有多远,没有歧义; 迭代自然:每一轮优化都可以作为下一轮的起点。 这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。 在SOL-ExecBench FlashInfer-Bench子集上表现靠前,就意味着模型在下面几项能力上具有优势: 长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。

F | 工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。

G | 稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。 系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。 这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。 三、训练侧搭建真实GPU环境,推理侧引入阿里智能体框架 智东西从千问团队获悉,在训练、推理方面,千问团队均针对Kernel Self-Evolving进行了优化。

H | 首先在训练侧,为了让模型真正具备kernel优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实GPU环境的大规模强化学习体系。 1、研究人员搭建了基于沙盒的真实GPU训练环境: 为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。这可以确保每一个训练信号都有真实的物理意义。 2、真实Kernel仓库作为训练数据 研究人员系统性收集了大规模真实的工程级kernel优化代码,以这些真实世界的kernel作为训练query。相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。 3、RL基础设施的针对性优化 Kernel优化任务的一个显著特点是需要超长的工具调用序列,单次优化过程可能涉及数十乃至数百轮的编译-执行-分析循环。 为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。 在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。 ▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub) 在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29354轮工具调用的持续迭代,在每一轮循环中对kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。 这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。 结语:从手写算子到AI生成、调优,Qwen3.8刷新自动化算子生成能力上限 Qwen3.8此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。 自动化GPU算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。
Current article:http://hu572qt.tibiantasangnenti.buzz/t2p/20260826/7335.html
Published on:18:18:28
下一篇:我国拟修法完善水价形成机制等规定 上一篇:金“蒜”盘闯出致富路
1
国台办:民进党当局对两岸教育交流合作极尽打压限控2
部分Pixel 7 Pro用户反馈滚屏体验问题 系统更新或可缓解3
黄智权同志逝世4
度小满维鲁斯,恶意扣款995
거창군의회, 건설폐기물 중간처리시설 불허가 처분 촉구6
最新版QMT怎么开通?量化交易门槛大降!10万即可开通QMT7
华电辽能:上半年净利润1.05亿元,同比增长22.06%8
【品种策略】PVC:08月26日多家期货公司晨报观点汇总9
3650米上,一口泉暖了游客的身子,鼓了乡亲的口袋10
市场监管总局部署实施2026年度燃气燃烧器具相关产品CCC认证有效性抽查11
“三五”规划正式公布 澳门迈向高质量发展新阶段12
Autoworkers add key Stellantis pickup truck plant to strikes13
极氪009西湖泡俩小时全程没断电没下沉:车主顺利开窗逃生14
Four More Shots Please! Trailer: The Girl Gang Returns One Last Time to Bid Farewell in Style15
以类脑赋能意识升维,以碳硅共生拓文明边界1
【股指期权排行榜】300ETF购8月4600大涨69.61%勇夺榜首2
‘We Are Congolese, Not Rwandans’; M23 Rebels Say ‘Ceasefire’ Doesn’t Cover Them Amid New Fighting3
米莱上任总统后,阿根廷迎来第二次全国大罢工4
서울시, 불꽃축제 앞두고 호텔 ‘바가지 요금’ 단속…위반 시 영업정지5
《剑星》体模尹雪花奶牛装COS美照6
今年台风为何这么多?专家解读7
一桥连世界!全球中文爱好者在福建“顶峰相见”8
劳伦斯奖晒近10年最佳男运动员获奖者:德约4次当选,梅西2次9
I Wanted to Carve a Niche Like Ayushmann Khurrana: Vikranth10
2026金球奖悬念渐消?凯恩57%遥遥领先,数据与荣誉的完美闭环11
总台秋晚寄相思 海外盛赞庆团圆_传播_中国12
数字赋能物流 智慧物联提质13
中国贸促会副会长刘健男会见百威亚太首席执行官兼董事会联席主席程衍俊一行14
河北新乐:每3天组织开展一次全员核酸筛查_采样_检测15
帮老人翻身,机器人还得学多久?Copyright @ 2016-2017 我的网站 版权所有