今天的 AI 新闻看似分散:高通重做手机芯片,微型模型进入智能眼镜,Agent 学会动态整理记忆,机器人开始保存回合经验,数据中心项目却出现延期风险。把这些线索放在一起,方向十分清晰:行业正在离开单纯比拼参数和榜单的阶段,转而争夺一套智能系统能否在真实设备上持续感知、记忆、推理并执行。模型仍是核心,但决定产品上限的越来越是模型之外的系统能力。

终端不再只是模型的显示器

  PrismML把微型大模型带到高通平台的智能眼镜,目标是用开放权重模型直接调用设备已有算力。与此同时,高通新一代骁龙被描述为开始围绕Agent重新设计,智能终端也被视作持续生产和消费token的入口。两者共同指向端侧AI的一次角色变化:过去,手机和眼镜只是云端模型的输入输出界面;现在,它们正在承担环境理解、个性化上下文保存和低延迟决策。

  这意味着芯片竞争不能再只看峰值算力。Agent需要长期驻留,频繁调用传感器,并在功耗、隐私和响应速度之间动态取舍。真正有价值的指标将变成单位能耗可完成多少任务、端云如何分配推理,以及开发者能否稳定调用系统级能力。终端厂商若只把大模型做成新的语音助手入口,很容易再次落入功能演示;谁能把模型、操作系统与硬件调度打通,谁才可能控制下一代应用分发权。

Agent进化转向记忆与Harness

  Just-in-Time Memory提出在任务到来时再整理历史经验,而不是任务结束后便将轨迹固化为永恒记忆。这一思路击中了Agent的实际难题:记忆并非越多越好,未经选择的经验会扩大上下文成本,也可能把旧任务中的错误策略带入新任务。按需筛选和重组记忆,本质上是在给Agent增加一层面向情境的信息治理机制。

  MemBodied则把问题推进到具身智能。视觉语言动作模型若只根据当前观察决策,就很难处理物体被遮挡、步骤存在依赖或环境状态跨时刻变化的操作。循环关联记忆让机器人保存回合级信息,说明机器人能力的提升未必只依赖更大的视觉语言模型,也取决于是否拥有可靠的内部状态。记忆系统将成为具身模型从“即时反应”迈向“连续行动”的基础设施。

  ModularRSI的探索更加激进:冻结模型权重,通过改进Harness让Agent持续进化。这里的Harness包括工具、提示、工作流、记忆和反馈机制。它挑战了“能力增长必然依赖重新训练”的默认路线,也更符合企业部署的现实——底座模型更新昂贵且风险高,而外围系统可以快速迭代、审计和回滚。未来的Agent竞争,很可能不是谁的单次推理最聪明,而是谁能建立稳定的自我诊断与流程优化闭环。

评测必须回到可验证结果

  仓库级动态代码基准开始检验大模型是否真正理解程序运行行为,而非只会从静态文本中寻找答案。这种转向十分必要:代码Agent最终要修改并运行软件,若评测仍依赖静态问答甚至另一个模型打分,就容易把表达流畅误判为工程可靠。执行结果、状态变化和故障复现,才是代码智能更难被投机的证据。

  StudentBench发现AI辅导与人类辅导可以取得相当的GRE学习增益,价值也不在于宣布教师将被替代,而在于把AI教育评价从“回答是否像老师”推进到“学生是否真的学会”。作者验证研究显示,对比学习优于传统分类路线;数学推理研究则发现,规则顺序不影响最终答案,却会改变内部表征。这些结果共同提醒业界:同一个正确答案背后,可能隐藏完全不同的推理稳定性、身份识别能力与泛化风险。

理论突破与基础设施约束并行

  高维潜变量的可扩散性研究关注预训练视觉编码器丢失细节后,扩散模型如何保持重建质量;排斥型自注意力研究揭示混沌、注意力凝聚和涌现局部性;更锐利的转导学习界限则尝试收紧有限样本下的理论保证。这些工作距离消费级产品较远,却在回答同一个基础问题:模型为何有效、何时失效,以及能否用更少数据和更稳定的表示获得能力。产业越深入复杂场景,对这些底层解释的需求就越强。

  另一端,Oracle向新墨西哥州Stargate数据中心发出不可抗力通知,为项目若无法在2028年上线时延后付款留下空间。这是对AI基建狂热的一次现实校正:训练与推理需求可以高速增长,但电力、施工、供应链和资金回报无法按软件速度扩张。TechCrunch Disrupt以同行票折扣吸引创业者,也折射出生态仍在积极聚集资本和项目;然而下一阶段的赢家,不会只靠宏大叙事,而要同时证明终端效率、Agent可靠性和基础设施兑现能力。

参考文献