多模态

多模态大模型技术文档,涵盖视觉理解(VLM)、图像生成、语音识别与合成、视频生成等跨模态模型,如 GPT-4o、Qwen-VL、Whisper、扩散模型(Diffusion)等。

可灵 AI 官宣 Kling 4.0 十月上线:30 秒原生长视频+10 关键帧分镜控制,AI 短剧从「抽卡」进入「分镜」时代

定档十月,Flash 版已率先开闸 快手旗下视频生成大模型可灵 AI 已于 9 月 28 日官宣,全新一代 Kling 4.0 将于 10 月正式上线,同日轻量版 Kling 4.…

Google Nano Banana 2.1 图像模型发布:14 张参考图保持 4 个角色一致,生成价格直接砍半

Flash 路线再升级:Nano Banana 2.1 正式版上线 10 月 6 日,Google 正式发布图像生成与对话式修图模型 Nano Banana 2.1,模型 ID 为…