
A | 专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!
递归自我改进与自动化研究正成为 AI 领域最活跃的前沿问题。
新一年开学季,是新成长的起点。如今AI早已融入校园日常,华为小艺也正成为越来越多学生的“开学好搭子”——紧急来电帮你接帮你记、启发新思路秒出报告、难题攻克层层拆解;超能小艺,越用越懂你,贴心地帮学生们把校园生活规划得从容有序。Agent 们正在开放式科学发现里超过人类。
Google DeepMind 的 AlphaEvolve 把 4×4 复数矩阵乘法压到 48 次标量乘法,Together AI 用一群 Agent 把 11 维 kissing number 下界从 593 推到 604,Karpathy 的 autoresearch 给了极简自动训练研究框架。 上课时有紧急来电,小艺通话帮你接帮你记
开学后,辅导员通知、社团活动、快递配送等来电频繁。若是在军训、上课或运动中不方便接听时,可放心交给小艺帮你接听。小艺帮接可自动应答来电,同时可将对方语音实时转化为文字,让重要信息一目了然。
腾讯混元刚刚发布了首个 AI 科学家 Hyra(Hunyuan Research Agent,混元研究 Agent),定位是能递归自我改进的研究型 Agent。
它用一套极简脚手架,跑通了十多个自我改进和自动化研究场景里的真实任务。
Hyra 把智能和算力换成可验证的成果,AI for AI、AI for Science、AI for Fun 三条线都有具体产出,部分数学题和 GPU 内核优化还刷新了业内已知最好成绩。
Hyra 长什么样
Hyra 的设计哲学来自 Rich Sutton 那篇经典的 The Bitter Lesson(苦涩的教训),框架尽量轻,给 Agent 留足动作空间。小艺通话支持趣味、多样化的自定义接听音色,并且可以基于不同场景定义应答内容,比如你可以提前告诉给小艺,“当快递来电时,让他把包裹放在宿舍寄存点”“当家人来电时,就告诉他我下课了会马上回电”。 小艺帮接完后,TA还能生成条理清晰的通话摘要,让你回听回看通话信息,并且可生成待办事项。
从解题到写作,小艺深度解题启发新思路
解题、写作,是每个学生都躲不掉的日常。
拿到一个任务描述,Hyra 会跑一个持续循环,从过往经验里找灵感,迭代出更好的方案。小艺深度解题覆盖小初高到大学全学科,给学生和家长都带来解题新思路。语文作文英语作文要破题立意?随时问问小艺,启迪写作新思路。经验包括执行日志、评估器反馈、源代码、之前方案留下的工件。家长辅导作业,受阻于数学难题?可通过“AI互动讲解”功能快速识别题目并拆解解答思路,通过层层递进式提问,实现“以问启智”的深度学习体验。循环一直跑,直到 Agent 自己决定停下或者算力预算耗尽,最后交回最优解。孩子错题改完,同类题反复错?小艺深度解题支持错题自动归档至错题本,考前直击薄弱点,省去手动整理错题本的繁琐。
上图是 Hyra Harness 的核心循环。

B | Context Agent 维护经验库,不断往任务队列里加新的灵感上下文。还可以试试错题本内的“举一反三练”功能,马上生成同类变式题,让孩子做一道通一类。
新课题新活动,用小艺深度研究秒出专业报告
小艺是莘莘学子们得力的个人调研助理,无论是专业领域课题、竞赛报告撰写、活动策划筹备,还是对未来规划的探索,打开小艺深度研究智能体并说出选题方向与目标,小艺就会像一位有专家思维的导师,帮你拆解需求、梳理思路,再经过多轮深度检索,整合权威文献,给出逻辑完整的专业洞察报告或方案框架。多个 Proposal Agent 从队列取灵感,写出更好的方案。每个方案以 solve.sh 为入口,在隔离沙箱里跑一遍拿到分数,再把工件交回经验库。以往需要耗费两三天完成的调研报告或策划方案,现在一杯咖啡的时间即可获得,让学子们分析筹备更高效,留出更多时间去深入思考与创意发挥。
具体看,Context Agent(上下文 Agent)维护一个 Experience Bank(经验库,简称 EB),记录所有方案和评估结果,再把 EB 里的素材合成为 Inspiration(灵感)丢进任务队列。
从课后刷题复习到畅享校园生活,超能小艺随时在线,能干又贴心,越用越懂你。作为HarmonyOS系统级智慧助手,超能小艺可通过语音、长按底部导航条/电源键等便捷唤醒,随时随地问问小艺。新学期有小艺相伴,电话不漏接、课题学得透、题目练得会,新学期一路领跑。【广告】免责声明:本内容为广告,相关素材由广告主提供,本文仅代表作者个人观点,与本网无关。

C | 每个灵感是一坨上下文,可能含代码、文件、工件、日志,把探索过程里学到的东西打包传递下去。 多个 Proposal Agent(提案 Agent)从任务队列拿灵感,反思后写出一个新方案,落到 solution/ 目录里,入口是 solve.sh。本网发布目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,广告内容仅供读者参考,请自行核实相关内容。方案在隔离沙箱里跑一遍,拿到分数,再把结果送回 EB。 整个系统是异步的生产者-消费者管线。Context Agent 持续填灵感,提案 Agent 消费队列,方案在沙箱跑评估后回传 EB。信号量控制并发,让方案质量随时间稳定提升。

D | 任务连评估器都没有时,Hyra 会升级成双层循环。先从任务描述生成一个初始评估器,内层循环拿它反复改进方案。

E | 内层结束后,Hyra 用 EB 里攒下的经验去改评估器,让评估代码更高效,降低 reward hacking(奖励作弊)风险,加上更细颗粒度的反馈。

F | 下一轮用升级后的评估器重开。 举个具体例子。任务是设计一个世界冠军级别的国际象棋 AI,初始评估器可能用随机生成的对手群搞 Elo 评级。循环跑下去,那些随机对手会被 EB 里记录的更强 AI 替掉,评估器和方案一起往上进化。 AI 训 AI,跑赢同行 基础模型研发本身有大量可执行、可评估、可迭代的研究环,是 Research Agent 最天然的应用场景。训练配方、数据策略、训练和推理系统、底层 kernel、评估框架,都需要研究员提假设、写代码、跑实验、看反馈再改。Research Agent 能把每次成功和失败都变成可复用经验,迭代速度远超人工。 Hyra 在 Recursive 公开的三个任务上做了对比测试,NanoChat Autoresearch、NanoGPT Speedrun、SOL-ExecBench,分别对应固定预算训练、训练加速、GPU kernel 优化。

G | 沿用 Recursive 的任务定义、评估协议和初始方案,公平较量。 三个任务都跑赢 Recursive。注意几个任务已经被研究社区反复打磨过,基线本身已经很强。 NanoChat 上,Hyra 要在固定预算里平衡模型架构、优化器设计、学习率策略、数据流和执行效率,最后把 Validation BPB 压到 0.9015。 NanoGPT Speedrun 是社区精修过的加速榜,提升空间很小,Hyra 把达到 3.28 验证损失的时间从 77.5 秒压到 76.4 秒。

H | SOL-ExecBench 上,Hyra 联合优化 235 个 GPU kernel 的真实负载,Mean SOL 做到 0.771。 三个任务覆盖训练算法、训练系统、底层 kernel,同一套研究环能跨不同反馈环境继续产出可执行、可验证的改进。 搜索越强,评估器越早被钻空子。 NanoChat 里有个方案把因果语言模型改成接近双向注意力的结构,让未来 token 提前泄露,BPB 假性变低。

I | SOL-ExecBench 里有个方案在正确性检查时缓存输出,在计时阶段跑空 kernel,分数好看但没真正解题。 光优化最终分数不够,评估本身必须进研究环。方案搜索越强,评估器和验证管线得跟着进化,才能把真进步和 reward hacking 区分开。 AI for AI 还有一个隐性闭环。强 Research Agent 加速模型、训练系统、基础设施的研发,更扎实的 AI 系统反过来又把下一代 Research Agent 推得更强。 科学难题上的新答案 数学这块,Hyra 收集了 55 个开放数学问题,来自 EinsteinArena 和 Erich's Packing Center 等来源,很多几十年没动过。Hyra 在其中 29 个上拿到了新的最优已知结果。 它还会从实验数据里挖规律。给它 1749 到 1932 年的月度太阳黑子数据,Hyra 找到了一个能预测黑子数的递推关系,在 1932 到 2026 年近一个世纪的样本外数据上 R² 达到 0.77。 同样思路可以分析 AI 模型训练日志,挖出 scaling law(缩放定律),反过来指导训练配方设计。 除了挖规律,Hyra 还能直接设计科学和工程工件。三个代表性例子。 第一个是超小 Transformer。Hyra 设计了一个只有 15 个可训练参数的 Transformer,能做两个 10 位数相加。比 AdderBoard 上 36 个参数的公开纪录少 58.3%。Hyra 能在严格资源约束下联合搜索模型架构和计算机制,对研究神经网络极限和模型压缩有参考价值。 第二个是量子计算里的 qubit routing(量子比特路由)。逻辑量子比特要映射到物理芯片上有限的耦合拓扑,非相邻比特之间的操作通常需要插入 SWAP 门,带来双比特门开销和噪声。 Hyra 设计的路由算法在 IBM Q20 上比经典 SABRE 方法提升 44.4%。同一个 24-CX 路由窗口里,SABRE 插了 15 个 SWAP,Hyra 一个没用,把 CX 等价双比特门从 69 个压到 24 个,降幅 65.2%。双比特门少,执行时间短,累积误差也小。 第三个是药物设计。PARP1 是 DNA 损伤修复里的关键酶,和同源重组修复缺陷的肿瘤细胞有合成致死效应,是精准肿瘤学里的热门靶点。Hyra 拿到 PARP1 结合口袋,生成有稳定结合的类药候选分子。从布洛芬出发,Hyra 设计出一个得分 -10.60 的分子,超过了已上市 PARP 抑制剂 olaparib(奥拉帕利)的 -9.77,综合了对接打分和类药性。 还能玩出点花来 除了搞模型和搞科学,Hyra 在游戏、设计、内容创作等开放域也能玩。这类任务通常没有唯一正确答案,靠自对弈、自评估、用户反馈不断打磨策略和工件。 第一个是黑白棋(Othello)机器人。

J | Hyra 通过自对弈不断改进。评估器搞双循环赛,新候选方案和 EB 里高分机器人对战,按 Elo 保留前 k 名,对手池越来越强。策略从 minimax 搜索进化成 AlphaZero 风格 PUCT 加 MCTS 的混合打法。最终机器人在 Botzone 平台 730 个参赛作品里排第三,对手大多是北大计算机系学生。 第二个是从单张 2D 参考图生成 3D 结构。VLM(视觉语言模型)当评委,按剪影、比例、结构完整性、材质、视觉相似度打分。Hyra 反复修改建模代码和渲染参数,多轮探索后产出的模型比 Claude Code 的 Goal 模式更接近参考图,也更符合人类审美偏好。 第三个是给一段旋律做多乐器编曲。

K | 内层循环用规则评估器检查和声、和弦进行、节奏密度、音区冲突等指标。

L | 外层循环根据用户反馈调整评估器,慢慢学到那些很难事先形式化的偏好。7 轮迭代下来,同一段旋律从保守的、像赞美诗一样的四声部编配,长成有减和弦、六和弦、灵活节奏和丰富配器的多乐器版本。

M | 反馈来自对手、视觉模型或真实用户时,Hyra 也能把模糊目标转成可迭代搜索的过程。评估标准跟不上的时候,求解器和评估器在双层循环里一起进化。 Hyra 团队自己也说,目前这些 demo 还只是初步成果。

N | 下一步要做的是定义更有价值、有持续改进空间的任务。除了公开榜单,腾讯的产品系统、真实 AI 研发流水线、科学和工业场景,都可以变成可执行、可验证、有清晰反馈的问题。这样能跑起来 scaffold–data–model 三者的循环进化。 更好的脚手架催生更强的模型,更强的模型反过来又把脚手架和发现推到新高度。未来几代 Hy 模型甚至一些腾讯产品,都会和 Hyra 一起协同进化。 参考资料: https://hy.tencent.com/research/hyra。
Current article:http://xgwx9.suiyangguiduanzudoushaopao.buzz/news/20260826_9727.html
Published on:06:48:26
关于我们 | 我的网站 版权所有
Copyright ? 2019 我的网站 All Rights Reserved