腾讯混元大模型在 SuperClue 和沙利文报告等第三方测评中获得高度评价,效果居于国内第一梯队。目前混元大模型已接入 600+ 腾讯内部业务,其应用场景广泛,如腾讯文档 AI 智能助手辅助文案创作、腾讯会议 AI 小助手自动总结、智能数字人和游戏 npc 的角色扮演能力增强用户体验、AI 代码生成等,实现技术与应用同行,充分释放生产力。
此外,腾讯混元大模型在多模态能力上也持续迭代升级。在生图领域,腾讯混元文生图基础架构已全面升级至 Sora 同款的 DiT 架构,支持中英文双语输入及理解,具备多轮绘图能力,测评结果国内领先;在生视频领域,腾讯混元支持文生视频、图生视频、图文生视频、视频生视频等多种视频生成能力,已经支持 16s 视频生成;在生 3D 层面,腾讯混元已布局文/图生 3D,单图仅需 30 秒即可生成 3D 模型。
目前,腾讯混元大模型多模态能力已通过腾讯云以 API 形式面向企业用户和开发者开放,在广告、电商、传媒、游戏、教育等不同行业落地应用。其中,混元生文提供了万亿参数 hunyuan-pro、千亿参数 hunyuan-standard、百亿参数 hunyuan-lite等多种尺寸的模型服务,期待更多伙伴与开发者加入,共同探索大模型的边界与新应用场景,携手推进大模型技术创新发展。
AI 写真照最初用户的使用门槛高,需要用户上传多张不同角度的照片,还要在线训练,对机器资源消耗较大,且可能影响用户体验。如何在不进行后置微调的情况下,只给一张人像照,让 Diffusion 模型具备人脸 ID 的保持、变化、风格化等能力,使得模型的生成结果具备多样性。对此,腾讯推出 FaceStudio,通过先进的混合人脸 ID 引导机制,在不牺牲个人身份特征的情况下,实现风格化的人物图像合成。这项技术成功应用在 QQ 头像定制馆、七夕头像等活动。
大多数扩散模型使用 CLIP 作为文本编码器,这将可能限制它们理解复杂提示的能力,对此腾讯推出 ELLA,可将 LLM 与扩散模型无缝结合,将 LLM 能力注入扩散模型,提升现有文生图模型语义匹配程度,还可轻松集成社区模型和工具,兼容社区生态。并进一步研发 EMMA 框架,解决角色一致性生成问题,使同一人物在不同场景中保持一致,实现连贯的视觉叙事。
在视频生成上,实现稳定且风格强烈的视频内容生成,展现在多人及单人场景中的良好应用效果,目前团队将相关算法落地在 QQ 短视频开发者开放平台。在 3D 生成上,打造超 Q 服饰纹理生成系统,落地超 Q 秀业务,给用户带来崭新体验。
开发者如何拥抱AI 2.0时代?
易编橙网络科技 CTO、「程序员 : 职场效能必修宝典」作者 田杰
开发者积极拥抱 AI 2.0时代,通过在 AIGC 工具层与应用层创新,在细分领域创造价值,无需畏惧被技术替代,致力成为利用 AI 提升业务与个人竞争力的先行者。
田杰鼓励开发者不应局限于传统编程语言的学习,更应关注如何结合 AI 技术提升个人竞争力,利用智能体为用户提供更高效、个性化的服务。他表示,“所有的 App 应用都值得用 AI 重新做一遍,这就是应用级开发者的机会”。尽管大型科技公司正积极布局大模型市场,但对于小型企业和个人开发者而言,专注于细分领域、创新业务模式和应用场景,利用好信息差和快速反应能力,如高考志愿填报助手等,通过快速响应市场需求和提供定制化解决方案, 实现技术与市场的有效对接。