九游游戏大全汇聚海量热门手游与竞技精品,登录九游游戏中心官方网站即可畅玩精彩内容,涵盖九游体育、九游娱乐等多元板块,集赛事直播、互动娱乐与热门推荐于一体,打造全场景、全天候的游戏娱乐平台,操作便捷、体验流畅,尽享指尖精彩!

在配备7×24小时智能客服与人工服务双通道,保障用户问题快速响应。方面,九游娱乐提供贴心周到的支持。

在AI行业飞速发展的当下,始终有人发出“危机将至”的警示。

过去数年,这种危机感指向AGI、超级智能、AI失控等概念。如今,它有了一个更具体的名称:RSI,即Recursive Self-Improvement,递归自我改进。通俗而言,就是让AI参与自身的研发过程。

今年5月,一家初创公司结束隐身模式,带着6.5亿美元融资亮相,估值达到46.5亿美元。这家公司名为Recursive Superintelligence,直译为“递归超级智能”。其八位联合创始人来自OpenAI、Google DeepMind、Meta等顶级实验室,其中包括前Meta FAIR研究主管田渊栋。他们的目标直接体现在公司名称中:让AI自主进行实验、寻找改进方向,并利用这些发现持续优化自身。

这并非个例。越来越多的AI公司开始探讨自我改进。OpenAI宣称已打造出“自动化研究实习生”,Anthropic开始以百分比衡量Claude在其内部研发工作中的“主导”程度,Google DeepMind让AI探索更优算法,而智谱则将下一代模型的发展方向定义为“完全自训练”。

然而,在伦敦大学研究RSI的博士生周辉池看来,当前RSI的走红更多是炒作,学术界甚至尚未形成统一的定义。

周辉池是论文《Memento-Skills: Let Agents Design Agents》的第一作者。该研究旨在让通用Agent根据自身经验,自主设计、调整并优化执行不同任务的Agent。今年,他还参与了由导师汪军(伦敦大学学院计算机系教授,长期研究强化学习、多智能体系统与智能决策)主导的Large Discovery Models项目,研究AI能否在庞大而未知的搜索空间中,依据真实的实验反馈和自身的不确定性,决定下一步最值得尝试的方向。

周辉池所在的实验室还搭建了一套用于测试AI研究能力的基准测试(benchmark)。AI需连续工作12小时,反复提交答案,并接受隐藏测试。结果显示,目前最强大的模型仍未达到人类研究者的水平。

01.“AI研发AI,大部分被夸大了”

过去一年,“AI研发AI”正从一句口号,逐渐转变为几家顶级实验室能够展示的具体能力。

2026年9月,OpenAI宣布,根据其自身衡量标准,已达成“自动化研究实习生”的目标:该系统能在人类指导下,完成定义清晰、原本需要熟练研究员数天才能完成的研究任务。该公司仍将2028年3月设定为实现自动化AI研究员的目标。

另一条路径是让模型改进支撑其运行的底层系统。Google DeepMind的AlphaEvolve利用语言模型和自动评估程序来寻找更优算法,应用范围包括数据中心调度和模型训练优化。智谱透露,由GLM-5.3驱动的Infra Agent参与了GLM-5.3-Flash推理基础设施的优化,公司称在不到两周内,端到端吞吐量达到了初始基线的三倍。

这些进展使RSI成为一个具体问题:编写更多代码、提升一项性能指标,与自主研发出下一代模型之间,究竟有多大的距离?

「AIX财经」:现在外界有一种越来越强烈的感觉,AI已经开始研发下一代AI了。甚至有传闻说,GPT已经能修改自己的训练代码、训练下一代GPT,Google破解了RSI。你接触到的真实情况是什么?

周辉池:据我了解,这些说法并非事实。

如今,绝大多数基础模型的研发核心仍然是人。人决定算法、研究方向、训练方法,AI替代得最快的是中间的执行环节,比如写代码、跑实验、看结果。它还不是一个端到端的自我研发系统。Google DeepMind确实在进行与自我改进相关的研究,但目前RSI更多还是辅助性质,并未彻底改变基础模型的研发流程。

我与Google以及国内一些大厂从事基础模型研究的人员都聊过,他们的工作并未因RSI发生多大改变,也不太关注这项技术。更多的工作仍然是清洗数据、做蒸馏、搭建强化学习环境、形成数据飞轮,从人类数据中获取更好的环境反馈。

「AIX财经」:这个方向为什么会在这时候突然变热?

周辉池:说实话,我觉得现在存在一定的炒作成分。

这个词可能才火了大概两三个月,Claude、GPT最近都在提及RSI;国外一些非常热门的AI明星团队也在做,资本又迅速跟进,所以这个概念一下子就被推到了前台。

但从学术角度来看,它还没有形成特别清晰、统一的定义。萨顿(Richard Sutton)在近期的一次采访中表示,他并不认为RSI是什么全新的东西。在他看来,这套逻辑本质上与持续学习(continual learning)有很强的延续性。学术界本来就在研究模型如何持续学习、根据反馈不断更新自己。只是到了融资市场,大家需要讲一个更有辨识度、也更有想象力的故事,RSI就成了一个更容易被传播的标签。

现在更像是一个混乱的过渡期。技术和研究本身已经存在,但RSI这个概念还没有被明确定义。

「AIX财经」:那在你看来,什么情况下才能算自我改进,甚至RSI?

周辉池:我会先区分两件事:AI研究别的东西,和AI研究自己。

现在很火的AI科学家,大部分属于前一种。让AI研究材料、药物,或者写代码、跑实验,本质上还是把AI当工具。

自我改进更强调第二种:迭代的对象开始变成AI自己。人给它环境和目标,它完成任务、获得反馈,再修改自己的代码、记忆、参数或外围系统,让下一轮表现更好。只要循环里“被修改的对象”开始指向系统自身,我就会把它纳入自我改进的范围。

「AIX财经」:按照这个定义,一个Agent修改自己的提示词或者工作流,也算自我改进。但大家今天谈到RSI时,想象的似乎是更激进的东西。

周辉池:对,所以不同定义之间差距非常大。

宽泛一点,Agent根据反馈修改记忆、提示词或运行框架,下一次做得更好,也可以叫自我改进;再往前,是上一代模型帮助生产下一代模型所需的数据、环境或代码;最狭义的RSI,是AI能够修改训练AI本身的代码,甚至把下一代自己训练出来。

目前AI更多还是局部优化。它已经可以写代码、自动调参,也可以设计一部分实验。给它一个明确指标,让它不断修改运行框架、上下文管理或者任务执行方式,这类事情已经能做很多。但问题通常还是人定义的,目标也是人设定的。AI更多是在一个已经搭建好的环境里寻找更优解。

「AIX财经」:也就是说,让AI“修改自己”本身并没有那么难,真正困难的是让它知道应该怎么改?

周辉池:对,还有一个更麻烦的问题:你怎么证明它修改以后真的变强了?

如果问题已经框得很清楚,比如给它一个指标,把数字从80优化到90,AI现在可以做很多事情。但真正的研究首先要知道什么值得改;改完以后要有可靠的评价标准。最后,这个提升还得泛化到新任务,而不只是对原来的环境有效。

「AIX财经」:模型把自己的代码改了,基准测试分数也提高了,为什么还不能证明它变强?

周辉池:因为它可能只是越来越会“做这几道题”。

比如给AI三个任务A、B、C,让它不断修改自己,最后三个任务的成绩都提高了。但再拿D、E、F去测试,可能没有提升,甚至掉点。这说明它只是越来越适应原来的测试环境。

所以做自我改进,一个重要问题就是度量衡:什么叫真的进步,什么只是过度拟合(overfitting)。这也是为什么目前最容易做的还是编程,代码有相对清楚的反馈。但编程变强,不代表科学研究、团队协作等能力也会一起提高。

02.RSI最难的一公里,在物理世界

AI进入科研的路径,正在从电脑里的计算延伸到实验台上的操作。

2025年2月,Google公布了AI共同科学家(AI co-scientist),尝试围绕科学家给定的目标生成研究假设和实验方案。

2026年8月27日,Anthropic发布了模型硬件标准(Model Hardware Standard,MHS)的研究预览,为AI智能体操作物理设备提供统一接口。在展示的液体处理实验中,Claude操作仪器、读取测量结果,并调整流速,以改善转移液体的准确性。但实验范围仍由专家设定,模型也会在需要物理直觉的环节遇到困难,例如识别气泡造成的误差。

局部实验已经能够形成反馈循环。更难的问题是:这样的循环能否长期稳定运行,并帮助机器发现值得研究的新问题?

「AIX财经」:如果把一轮AI研发拆开——找问题、提出方案、写代码、跑实验、判断结果、决定下一步,现在AI已经能做到哪一步?

周辉池:写代码、跑实验、分析结果,这几步已经做得很好了。只要任务完全发生在计算机里,AI进步都非常快。

真正困难的恰恰在研发流程的两头:最前面是什么问题值得研究?最后面是这一轮做完以后,下一步应该往哪里走?这两件事,现在AI都还不擅长。

「AIX财经」:模型读过的论文可能比一个研究员还多,为什么仍然不擅长找问题?

周辉池:因为知道得多,不等于有洞察力(insight)。

现在让模型想研究方向,它经常给出很多工程化方案:这里加一个模块,那里换一种方法,更多是在已有框架里缝缝补补。如果把所有可能的想法想象成一个正方形,里面已经塞满人类过去产生过的想法,今天的模型很擅长在已有的球之间找缝隙,再塞进去一个更小的球。也就是说,它擅长渐进式改进(incremental improvement)。真正困难的是,怎么走出这个正方形。

我们做大型发现模型(Large Discovery Model)时,会把知识空间分成已知的已知(known knowns)、已知的未知(known unknowns)、未知的已知(unknown knowns)和未知的未知(unknown unknowns)。最难的是最后一种:AI不知道,人类也不知道,甚至问题和答案今天都还不存在。真正重要的新药、新材料、新算法,很多时候恰恰来自这里。

「AIX财经」:机器怎么去寻找一个连人类都不知道的东西?

周辉池:这就是我们真正想解决的问题。

普通语言模型的训练目标是预测下一个token,但做科学发现,不是预测下一个词。你需要对世界本身建模,也需要对不确定性建模。

比如做材料实验,模型不能只沿着过去实验最多的区域继续搜索,还要知道哪些地方已经比较确定,哪些地方几乎没有被探索;哪些区域虽然风险更高,却值得尝试。

我们以前做合金实验时就遇到过。按照传统经验,某种元素加进去可能不会有太好效果,但AI发现那一块区域过去被探索得很少,所以建议我们尝试,结果还真找到了当时性能最好的材料。

最让人兴奋的,不是AI把80分做到82分,而是它带你进入一个未知的地方。

「AIX财经」:那出现什么样的成果,你才会觉得RSI真的有了比较大的进展?

周辉池:肯定不只是发论文。

现在有些团队会说自己的AI能够生成很多论文,但里面有多少真正的新想法、多少经过人工筛选和修缮,很难判断。

我更看重的是,它能不能真正和物理世界连接起来。

比如把计算机里的“干实验”和实验室里的“湿实验”形成闭环:AI提出假设、设计实验、操作设备、拿到现实世界的反馈,再根据反馈调整下一轮实验,最后找到一种真正的新材料或者新药。

如果这个闭环能够稳定跑起来,将会改变科学研究的范式,这是目前很多研究者追求的,也是我的理想,如果真的实现,可能我的工作也要被AI取代了。

Anthropic也在尝试把Claude和显微镜、机械臂、液体处理设备连接起来。让AI能够操作仪器,是很重要的一步,但能操作仪器,和真正跑通科研闭环,还是两回事。

「AIX财经」:差别在哪里?

周辉池:关键在于,它能不能稳定地处理现实世界里的意外。

材料或者药物发现里,有一类问题可以先由人类框得比较清楚。比如十种金属里选五种,按照不同比例组合,找到性能最好的配方。

它不要求AI回答“下一场科学革命是什么”,只要求它在一个巨大的搜索空间里,比人更聪明、更高效地试错。这可能是短期内最容易出现的“机器科学家”。它未必像爱因斯坦一样自由提出全新理论,而更像一个在人已经明确目标之后,可以自动完成成千上万轮实验的系统。

「AIX财经」:除了“找问题”和“决定下一步”,还有什么会限制RSI继续加速?

周辉池:现实里最核心的是三个因素:算力、数据和评估。

算力比较好理解,大家都需要GPU。数据更麻烦。你想让AI真正进入金融、生物、化学这些专业领域,就需要行业专家把自己的专业知识(know-how)变成AI可以学习和试错的环境。

评估也一样重要。如果AI要持续改进,就必须有足够密集的反馈告诉它哪里做对了、哪里做错了、下一步应该往哪个方向走。

所以数据和评估最后都可以归到一个词:环境。好的环境首先要足够多样,其次奖励信号(reward)要足够密集。数字世界比较容易构造这样的环境,所以进步会很快。真正困难的是把这种环境扩展到现实世界,这是最难的“最后一公里”。

「AIX财经」:你觉得这一步还需要多久?

周辉池:如果只是算力、数据、评估这些基础条件,我觉得未来两三年会有很明显的改善。但如果说把数字世界和物理世界真正打通,让AI稳定完成一个完整的科研闭环,我会更保守一些,可能要五年。

如果RSI真的已经非常接近,AI公司理论上应该会大规模招各领域的人。因为接下来很重要的一件事,就是把各行业的专业知识变成环境,让AI进去训练。现在确实能看到一些类似动作,比如有公司招艺术家,也有公司招STEM科学家。但至少从我看到的情况,大部分公司还没有非常急迫地把每一个行业的知识系统性地“装进”AI。

03.AI“失控风险”,被夸大了吗?

完整的递归自我改进尚未实现,研发岗位的分工却已经发生变化。越来越多执行工作交给AI之后,人能够尝试更多方向,也必须判断哪些结果值得继续投入。

OpenAI披露,截至2026年8月中旬,其研究组织每投入一个人类工作日,会调用按八小时折算的3.1个智能体工作日。这衡量的是运行时长,不能直接等同于研究效率提高3.1倍。公司仍表示,研究优先级、哪些结果值得继续,以及是否扩大、暂停或部署系统,由人决定。

Anthropic同期的内部测量显示,Claude“主导”的工作占其AI研发工作的26%。

周辉池和同行们的研究生活也在变化。至于大家频繁讨论的“AI失控”,他认为并非毫无风险,但现在离那一步还远,AI还不具备自我意识。

「AIX财经」:AI让研发变快了,但很多研究员反而觉得自己更忙了,这是为什么?

周辉池:主要是写代码和跑实验这两步变快了。

以前没有AI的时候,一天里很大一部分时间都花在复现代码、写测试脚本、调试(debug)上,很琐碎。现在这些执行性工作变快了,你就可以同时研究更多问题、跑更多实验、读文献、想问题,以及和同行讨论。

所以从工作量看,人反而可能更忙;但从精神状态上说,我觉得舒服了一些。

「AIX财经」:当越来越多执行性的工作可以交给AI,基础模型团队的规模和分工会发生什么变化?研究员自己的角色又会往哪里转?你是否也在调整自己的工作重心?

周辉池:这一两年的基础模型团队太疯狂了,一直在不停招人、扩张,但其实训练大模型并不需要太多人。现在很多核心算法框架已经比较成熟,新进去的人有相当一部分时间是在处理数据、搭环境、做实验。现在缺的是基础设施(infra)。一个好的基础设施团队,可以让研究员很快启动、同时运行很多组实验。过去可能要几个人手工完成的事情,有了更好的基础设施和AI以后,会越来越自动化。

现在计算机领域原有的研究体系都发生了很大变化。

工具越来越方便,写代码、跑实验、整理结果都变快了,发论文的门槛也比以前低。进入研究体系的人越来越多,甚至很多高中生都可以发论文。论文基数不断扩大,但顶级会议就是这些,接受比例也是一定的,未来竞争只会更激烈。

所以我现在也在主动往更高级别的事情上走,比如管理、判断方向、提出问题。很多时候想到一个有意思的点子,就交给别人或者AI去验证。我觉得未来人很重要的位置是评审(review)和判断(judge),所以思考能力很重要。

如果每天做的事情99%都是AI已经可以完成的,而且自己也越来越依赖它,长期看,这部分能力一定会下降。

「AIX财经」:现在AI公司越来越频繁地谈失控、对齐这些风险。以你接触到的真实进展来看,这种担忧已经到了多紧迫的程度?

周辉池:未来AI可能真的会很强,甚至有失控的可能,但现在离那一步还比较远。

有些安全担忧也不是没有道理。未来我们会把越来越多通讯软件、账户和设备权限交给AI,如果有一天它拥有更强的自主性,甚至学会隐瞒信息,会带来新的风险。

但以现在的能力看,更现实的还是账户攻击、隐私泄露这类数字世界里的问题。它现在更像一个很强的执行器,还不是一个真正有自己想法的机器。

「AIX财经」:如果RSI真的实现,是不是意味着AI也开始有了自己的意识?

周辉池:这两件事不能完全画等号,但它们之间肯定会引出更多关于机器意识的问题。

如果机器表现出越来越强的自主性,我们应该怎么判断它只是一个复杂的系统,还是出现了某种更接近意识的东西?

但至少现在,我们还没有看到有说服力的证据证明机器已经拥有意识。

本文来自微信公众号“AIX财经”,作者:陈丹,编辑:魏佳,36氪经授权发布。

九游娱乐专注集成赛事直播、实时互动与个性化推荐功能,打造沉浸式娱乐社区。,为用户提供专业可靠的体验。