近日,阶跃星辰宣布开源其图像编辑大模型 Step1X-Edit,宣称模型性能达到开源领域最新水平(SOTA)。据悉,该模型支持多种高频图像编辑任务类型,包括但不限于文字替换、风格迁移、材质变换、人物修图等 11 类,涵盖了图像编辑的常见需求。
Step1X-Edit 模型总参数量为 19B,其中包含 7B 的 MLLM(可能指多模态语言模型)和 12B 的 DiT(可能指扩散模型)。该模型针对自然语言图像编辑任务,具备以下三项核心能力:
语义精准解析:Step1X-Edit 能够理解并执行自然语言描述的复杂组合指令,无需预先设定模板。这使得用户可以灵活地进行多轮、多任务的图像编辑操作。同时,该模型还支持对图像中的文字进行识别、替换与重构,极大地提升了图像编辑的效率和灵活性。
身份一致性保持:在进行图像编辑时,Step1X-Edit 能够稳定地保留人脸、姿态与身份特征。这一能力对于虚拟人、电商模特、社交图像等需要高一致性的场景尤为重要。
高精度区域级控制:Step1X-Edit 支持对指定区域进行文字、材质、色彩等定向编辑,同时保持图像整体风格的统一。这种精细化的控制能力,使得图像编辑结果更加自然、逼真。