返回 讨论 apply CMS 文章

Supra2-IMG:100M 参数文本到图像模型,单张 H100 训练不到 10 小时

100M 参数 DiT 文本到图像模型,单卡 H100 训练不到 10 小时,开源且可在本地运行。

文本到图像DiT开源模型轻量级
成长分 / 100 77 综合收获、行动、留存与影响

Supra2-IMG:100M 参数文本到图像模型,单张 H100 训练不到 10 小时
为什么值得读了解一个极小参数量的文本到图像模型如何实现 SOTA 质量。

获取完整的本地推理步骤和命令,快速上手体验。

关键洞察
  1. Supra2-IMG 是一个 100M 参数的 DiT 文本到图像模型,完全从零开始训练。
  2. 训练在 Runpod 的单张 H100 上不到 10 小时完成。
  3. 模型能在 256x256 分辨率下生成最先进质量的图像。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1603

大家好!

距离上一个 SupraLabs 模型已经过去挺久了——但今天我们给大家带来点特别的东西:Supra2-IMG

这是一个 100M 参数的 DiT 文本到图像模型,完全从零开始训练,在 Runpod 的单张 H100 上不到 10 小时就完成了训练。它能在 256x256 像素分辨率下生成最先进质量的图像。

示例:

这些示例并非精挑细选!采样设置:seed 0,steps 50,cfg 3.0;每张图像都使用相同设置。

如果这里有人对提示词感兴趣,我可以给你们!尽管问!

你也可以在自己的硬件上本地使用该模型(在

CPU

上生成一张图像约 20 秒(🤩),在 GPU 上约 2 秒):

首先,运行:

创建项目目录

mkdir Supra2-IMG

cd Supra2-IMG

下载推理脚本

wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py

然后,你可以通过运行以下命令来生成图像:

python inference.py --prompt "a sea jellyfish floating in the pitch-black ocean depths" --seed 0 --cfg 3.0 --steps 50 --n 1 --out jellyfish.png

玩得开心 🤗 🔥

HF 上的模型链接:

https://huggingface.co/SupraLabs/Supra2-IMG

如果你愿意,可以在 HF 上给我们点个赞并关注 🤗 ❤️

欢迎大家提出任何反馈!有任何问题尽管问!

阅读更多

讨论精选

413205 (133↑):也许可以发到 r/stablediffusion

?那里更像是图像生成爱好者的聚集地。

Hot_Example_4456 (95↑):对于一个 100M 参数的模型来说,这质量简直不可思议……干得漂亮。

GasSmooth7439 (69↑):我们已经习惯了文本到图像意味着大模型 + GPU,看到这么小的东西几乎能在任何设备上本地运行,感觉真是一股清流。