Z
0

Z-Image

Z-Image(造相)是通义实验室推出的一款高效图像生成基础模型,基于单流扩散Transformer架构(Scalable Single-Stream DiT, S3-DiT),参数量达60亿。

链接直达

Z‑Image (造相)是阿里巴巴通义实验室(Tongyi‑MAI)在 2025 年开源的高效图像生成基础模型,代码托管在github。模型规模约 60 亿参数,采用 单流 Diffusion Transformer(DiT)‍ 架构,将文本理解与图像生成统一在同一网络中,实现了“思考‑生成”一体化的工作流。

Z-Image插图

通过 Decoupled‑DMD(Distribution Matching Distillation)‍ 技术,Z‑Image‑Turbo 版本在仅 8 步(8 NFE)‍ 推理下即可生成高质量、逼真的照片级图像,推理时间常在亚秒级,显著优于同类大模型。模型特别擅长 中英文双语文本渲染,能够在图像中准确呈现复杂的中文字符,这在开源图像生成模型中极为罕见。

Z‑Image 提供了多种变体:

  • Z‑Image‑Base:原始基线模型,适合研究与二次开发;
  • Z‑Image‑Turbo:轻量蒸馏版,兼顾速度与质量,适合商业化部署;
  • Z‑Image‑Edit:支持图像编辑与局部修改的扩展模型。

项目配套了官方文档、在线 Demo(Hugging Face、ModelScope)‍ 以及 托管 API 服务,用户只需几行代码即可调用模型生成图像,广泛用于创意设计、内容创作、营销素材、电子商务摄影等场景。

Z‑Image 通过参数压缩与架构创新,实现了 高效、低成本、易部署 的图像生成解决方案,既满足科研实验的可复现需求,也为企业级应用提供了快速、可靠的视觉内容生产工具。

相关推荐

库拉AI-KULAAI

国内直连GPT,Gemini,grok,Claude等顶级模型,支持文件上传和联网搜索

大模型_API中转站

提供优质的Gemini、Claude、OpenAI、Midjourney、Suno、Luma等种AI模型API接入服务。

AI Ping

AI Ping是面向大模型使用者,提供全面、客观、真实的大模型服务评测与信息汇总平台。提供长周期、高频率、多时段评测数据,助力您高效完成大模型服务的选型与供应商评估

怪兽AI知识库大模型

知识库大模型,智能客服,智能问答,AI写作

Seedance

字节跳动豆包大模型团队推出的前沿视频生成基础模型。该技术通过整合多模态生成能力(文本,图片,音频,视频)与底层的MMDiT架构,实现了“原生音画同步”与“多镜头长叙事”的突破。

评论

暂无评论,来抢沙发~