多模态大模型技术文档,涵盖视觉理解(VLM)、图像生成、语音识别与合成、视频生成等跨模态模型,如 GPT-4o、Qwen-VL、Whisper、扩散模型(Diffusion)等。
定档十月,Flash 版已率先开闸 快手旗下视频生成大模型可灵 AI 已于 9 月 28 日官宣,全新一代 Kling 4.0 将于 10 月正式上线,同日轻量版 Kling 4.…
Flash 路线再升级:Nano Banana 2.1 正式版上线 10 月 6 日,Google 正式发布图像生成与对话式修图模型 Nano Banana 2.1,模型 ID 为…