❯ 英伟达用 Codex 一天将 Cosmos 3 Nano 准确率从54%拉至93%
智能体验证据英伟达方面演示,其团队用 Codex 搭配 TAO agent skills,把视频推理模型 Cosmos 3 Nano 在丰田 woven 交通安全数据集上的四选一准确率从 54.41% 拉至 93.35%(据英伟达披露),耗时约一天、仅用两条提示。
方法此前模型微调要靠算法工程师数周排期,这次实验基于 8000余条 训练与验证样本,Codex 自主完成数据整理、微调与评估循环,无需人工逐轮介入。英伟达将其作为 agent 自动驾驶模型训练 的范例,凸显大模型写训练任务、跑实验、读指标的闭环能力,原本数周的流程被压进一天。
门槛这把模型微调的 人力门槛 压到两条提示,工程侧的重复劳动被 agent 接管,开发者评估训练任务的维度从“写不写得动代码”变成“提不提得对需求”。下一步要看此类范式能否从视频推理扩展到更宽的训练任务,以及英伟达是否把它做成标准 TAO 工作流对外交付,让非专家也能靠自然语言完成模型迭代,否则它只是英伟达自家的一个漂亮 demo。
signal: 写训练循环的事交给模型自己,工程师退到两条提示之后。