开云kaiyun官方网站接洽引入了可学习的 Soft-Prompt-kai云体育app官方下载app最新版本-kai云体育app官方登录入口

  • 首页
  • 关于我们
  • 新闻中心
  • 工程案例
  • 荣誉资质
  • 诚聘精英
  • 联系我们
  • 你的位置:kai云体育app官方下载app最新版本-kai云体育app官方登录入口 > 新闻中心 > 开云kaiyun官方网站接洽引入了可学习的 Soft-Prompt-kai云体育app官方下载app最新版本-kai云体育app官方登录入口
    开云kaiyun官方网站接洽引入了可学习的 Soft-Prompt-kai云体育app官方下载app最新版本-kai云体育app官方登录入口
    发布日期:2026-09-18 10:35    点击次数:128

    机器东说念主亦然卷疯了!

    不仅能叠穿着,并且一干便是俩小时,且全程无任何扶持。

    清华大学智能产业接洽院(AIR)与上海东说念主工智能实验室取悦发布通用跨履行具身基座模子 X-VLA,通过翻新的 Soft-Prompt 机制、高效的框架假想与定制化覆按范式,显贵擢升预覆按限度与模子性能。

    更要津的是,X-VLA 是首个齐全 120min 无扶持自主叠衣任务的全开源模子(公开数据、代码与参数),以仅 0.9B 的参数目在五大泰斗仿真基准上全面刷新性能记录。

    中枢才调

    为克服不同机器东说念主平台在解放度、相机不雅测视角等履行参数上的分歧,接洽引入了可学习的 Soft-Prompt。

    该机制动态地将具身履行的硬件成就信息编码为一种连气儿表征,使模子在预覆按中粗略解耦任务战术与具体履行器,从而显贵增强模子对异构机器东说念主平台的符合能力,并擢升搀和数据覆按的褂讪性与限度。

    针对机器东说念主任务中多源视觉输入的异质性,接洽团队提议了分治编码决议。

    任务研究的主视角图像由高性能视觉 - 谈话模子编码,以索求高层语义特征;而主要提供低眉目空间反应的扶持视角,则通过轻量化的网罗进行局部特征索求。

    该战术在保证信息完满性的前提下,优化了筹办资源的分拨,擢升了模子的信息处罚通量。

    模子骨干取舍程序 Transformer 架构,以确保精湛的推广性与通用性。看成生成模块放置了传统的细目性输出战术,转而取舍先进的flow-matching,以概率生成的花样建模机器东说念主看成序列。

    该才调显贵增强了看成轨迹的平滑性与对不细目环境的鲁棒性,为永劫序任务的奏效履行奠定了坚实基础。

    在预覆按阶段,接洽取舍大规模高质料异构数据,主要秉性如下所示:

    平衡化数据采样:定制数据采样战术,确保异构数据集的平衡覆按,幸免模子偏畸。

    多模态数据清洗与时空对皆活水线:团队对原始机器东说念主操作数据实施了严格预处罚,包括:将不同空间下的看成数据调处映射至程序任务空间;对高频率齐集的数据进行时序层面的对皆与重采样。

    此进程极大擢升了现象 - 看成序列在时分上的一致性逻辑与举座质料。

    以语义 - 看成对皆为导向的数据彩选程序:团队缔造了严格的数据质料门槛,中枢是筛选视觉帧了了、谈话提示姿首精确且与后续看成序列高度关联的数据样本。

    此举从起源上确保了模子学习到的是有明确因果关连的"行为常识",而非浅层的荒唐关联。

    在后覆按阶段,接洽主要在两个方面进行了妥洽。

    分层分组的自符合学习率妥洽

    鉴于模子中不同组件(如预覆按冻结的 VLM、新引入的 Soft-Prompt、骨干 Transformer 等)的参数规模与敛迹秉性相反,团队为其施加了分组别、分歧化的学习率退换战术。

    该假想既保护了预覆按取得的基础常识,又允许要津适配层快速妥洽,从而在保证覆按褂讪性的同期,大幅优化了敛迹限度。

    面向异构模块的渐进式 warm-up 战术

    关于模子中新引入的可学习参数(如 Soft-Prompt),团队在覆按启动阶段取舍线性递加的学习率热身机制,使其参数空间得以镇定启动化,再冉冉融入全局优化过程。

    该战术有用幸免了覆按初期因梯度巨变导致的不褂讪性,尤其适用于异构模块的协同覆按。

    实验限度高效预覆按:可推广的架构上风

    可推广的架构上风 X-VLA 的预覆按缩放定律(Scaling Laws)弧线呈现出优异的线性增长趋势。这标明,跟着模子参数以及覆按数据规模的同步扩大,其在测试集的开环测试性能呈现褂讪、可掂量的擢升。

    这一表象考据了所提议的 Soft-Prompt 机制与纯粹 Transformer 架构的重大可推广性,为构建更大规模的具身智能基座模子奠定了坚实基础。

    数据与算法的协同优化

    成绩于高质料的预覆按基座,X-VLA 在后覆按(微调)阶段展现出极高的数据限度与褂讪性。针对不同的卑劣任务(如自主叠衣),只需使用中小规模的场景专属数据进行微调,模子便能快速符归拢达到 SOTA 性能。

    这源于预覆按阶段学习到的通用视觉 - 谈话 - 看成表征,以及后覆按中取舍的定制化学习率战术与慢启动机制,它们共同确保了常识从通用域到特定任务的高效、褂讪搬动。

    X-VLA 除了在包括 LIBERO、SIMPLER 等在内的泰斗仿真环境中取得 SOTA 发扬外,在竟然的机器东说念主平台上,该模子也在多数毛糙执取和桌面操作任务中展现了重大性能,并奏效完成了无尽时长的自主叠衣任务,展示了其应陈述杂长程任务的超卓能力。

    容颜主页:https://thu-air-dream.github.io/X-VLA/

    代码:https://github.com/2toinf/X-VLA.git

    论文贯穿: https://arxiv.org/pdf/2510.10274

    一键三连「点赞」「转发」「防御心」

    接待在指摘区留住你的念念法!

    —  完  —

    � � 点亮星标 � �

    科技前沿进展逐日见开云kaiyun官方网站