腾讯混元大模型现已支持“文生图”功能，将陆续向用户开放

2023-10-26 15:17IT之家 - 浩渺（实习）

感谢IT之家网友司空哲一、心语挚友的线索投递！

IT之家 10 月 26 日消息，据“鹅厂技术派”消息，腾讯混元大模型近日迎来全新升级，并正式对外开放“文生图”功能。官方宣称，升级后的腾讯混元中文效果整体超过 GPT3.5，代码能力大幅提升 20%，达到业界领先水平。

▲ 图源鹅厂技术派公众号

据介绍，大模型文生图的难点体现在对提示词的语义理解，生成内容的合理性以及生成图片的效果，针对这三个技术难点，腾讯进行了专项的技术研究，提出了一系列原创算法：

在语义理解方面，腾讯混元采用了中英文双语细粒度的模型，模型同时建模中英文实现双语理解，而不是通过翻译，通过优化算法提升了模型对细节的感知能力与生成效果，有效避免多文化差异下的理解错误。
在内容合理性方面，AI 生成人体结构和手部经常容易变形。混元文生图通过增强算法模型的图像二维空间位置感知能力，并将人体骨架和人手结构等先验信息引入到生成过程中，让生成的图像结构更合理，减少错误率。
在画面质感方面，混元文生图基于多模型融合的方法，提升生成质感。经过模型算法的优化之后，混元文生图的人像模型，包含发丝、皱纹等细节的效果提升了 30%，场景模型，包含草木、波纹等细节的效果提升了 25%。