今天的 AI 新闻看似分散:高通重做手机芯片,微型模型进入智能眼镜,Agent 学会动态整理记忆,机器人开始保存回合经验,数据中心项目却出现延期风险。把这些线索放在一起,方向十分清晰:行业正在离开单纯比拼参数和榜单的阶段,转而争夺一套智能系统能否在真实设备上持续感知、记忆、推理并执行。模型仍是核心,但决定产品上限的越来越是模型之外的系统能力。
终端不再只是模型的显示器
PrismML把微型大模型带到高通平台的智能眼镜,目标是用开放权重模型直接调用设备已有算力。与此同时,高通新一代骁龙被描述为开始围绕Agent重新设计,智能终端也被视作持续生产和消费token的入口。两者共同指向端侧AI的一次角色变化:过去,手机和眼镜只是云端模型的输入输出界面;现在,它们正在承担环境理解、个性化上下文保存和低延迟决策。
这意味着芯片竞争不能再只看峰值算力。Agent需要长期驻留,频繁调用传感器,并在功耗、隐私和响应速度之间动态取舍。真正有价值的指标将变成单位能耗可完成多少任务、端云如何分配推理,以及开发者能否稳定调用系统级能力。终端厂商若只把大模型做成新的语音助手入口,很容易再次落入功能演示;谁能把模型、操作系统与硬件调度打通,谁才可能控制下一代应用分发权。
Agent进化转向记忆与Harness
Just-in-Time Memory提出在任务到来时再整理历史经验,而不是任务结束后便将轨迹固化为永恒记忆。这一思路击中了Agent的实际难题:记忆并非越多越好,未经选择的经验会扩大上下文成本,也可能把旧任务中的错误策略带入新任务。按需筛选和重组记忆,本质上是在给Agent增加一层面向情境的信息治理机制。
MemBodied则把问题推进到具身智能。视觉语言动作模型若只根据当前观察决策,就很难处理物体被遮挡、步骤存在依赖或环境状态跨时刻变化的操作。循环关联记忆让机器人保存回合级信息,说明机器人能力的提升未必只依赖更大的视觉语言模型,也取决于是否拥有可靠的内部状态。记忆系统将成为具身模型从“即时反应”迈向“连续行动”的基础设施。
ModularRSI的探索更加激进:冻结模型权重,通过改进Harness让Agent持续进化。这里的Harness包括工具、提示、工作流、记忆和反馈机制。它挑战了“能力增长必然依赖重新训练”的默认路线,也更符合企业部署的现实——底座模型更新昂贵且风险高,而外围系统可以快速迭代、审计和回滚。未来的Agent竞争,很可能不是谁的单次推理最聪明,而是谁能建立稳定的自我诊断与流程优化闭环。
评测必须回到可验证结果
仓库级动态代码基准开始检验大模型是否真正理解程序运行行为,而非只会从静态文本中寻找答案。这种转向十分必要:代码Agent最终要修改并运行软件,若评测仍依赖静态问答甚至另一个模型打分,就容易把表达流畅误判为工程可靠。执行结果、状态变化和故障复现,才是代码智能更难被投机的证据。
StudentBench发现AI辅导与人类辅导可以取得相当的GRE学习增益,价值也不在于宣布教师将被替代,而在于把AI教育评价从“回答是否像老师”推进到“学生是否真的学会”。作者验证研究显示,对比学习优于传统分类路线;数学推理研究则发现,规则顺序不影响最终答案,却会改变内部表征。这些结果共同提醒业界:同一个正确答案背后,可能隐藏完全不同的推理稳定性、身份识别能力与泛化风险。
理论突破与基础设施约束并行
高维潜变量的可扩散性研究关注预训练视觉编码器丢失细节后,扩散模型如何保持重建质量;排斥型自注意力研究揭示混沌、注意力凝聚和涌现局部性;更锐利的转导学习界限则尝试收紧有限样本下的理论保证。这些工作距离消费级产品较远,却在回答同一个基础问题:模型为何有效、何时失效,以及能否用更少数据和更稳定的表示获得能力。产业越深入复杂场景,对这些底层解释的需求就越强。
另一端,Oracle向新墨西哥州Stargate数据中心发出不可抗力通知,为项目若无法在2028年上线时延后付款留下空间。这是对AI基建狂热的一次现实校正:训练与推理需求可以高速增长,但电力、施工、供应链和资金回报无法按软件速度扩张。TechCrunch Disrupt以同行票折扣吸引创业者,也折射出生态仍在积极聚集资本和项目;然而下一阶段的赢家,不会只靠宏大叙事,而要同时证明终端效率、Agent可靠性和基础设施兑现能力。
参考文献
- TechCrunch: Bring your co-founder, partner, or colleague and get 50% off a second TechCrunch Disrupt 2026 pass
- TechCrunch: PrismML brings its tiny LLMs to Qualcomm-powered smart glasses
- TechCrunch: Oracle sends force majeure notice on its New Mexico Stargate data center
- arXiv: On the Diffusibility of High-Dimensional Latents
- arXiv: Contrastive Learning for Authorship Verification
- arXiv: Even Sharper Bounds for Transductive Learning and Its Applications
- arXiv: Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark
- arXiv: Nonequilibrium Phases of Repulsive Self-Attention
- arXiv: Order-Invariant Answers, Order-Sensitive Representations in Mathematical Reasoning
- Hugging Face: Just-in-Time Memory
- Hugging Face: MemBodied
- Hugging Face: StudentBench
- 机器之心: 高通这一代骁龙:手机芯片,开始为Agent重新设计
- 机器之心: 智能终端变成token工厂,这家公司要让AI真正被深度使用
- 机器之心: 冻结模型权重,Agent还能持续进化:ModularRSI探索Harness自我改进