Spring Ai超简单教程系列 - 05多模态
在网上找了一些Spring AI相关的教程,因为官方API更新较快的原因,大部分教程的内容都已过时。所以在参照官方参考文档学习的同时,沉淀每篇文章,为同样热爱学习的你,提供参考。
本系列教程参考Spring AI官方1.1.x版本文档:https://docs.spring.io/spring-ai/reference/1.1/index.html
多模态
多模态是指大模型能够同时理解和处理不同类型的输入信息,包括文本、图像、音频以及其他数据格式。
这里我们识别图片内容为例,展示多模态资源调用大模型的过程:
示例图片
在项目/resources/ststic/目录下放一个图片:

多模态调用代码:
@GetMapping("/ai/multimodality")
String explainImage() {
ClassPathResource imageResource = new ClassPathResource("/static/tiananmen.jpeg");
UserMessage userMessage = UserMessage.builder()
.text("图片中是哪个地方?")
.media(new Media(MimeTypeUtils.IMAGE_JPEG, imageResource))
.build();
Prompt prompt = new Prompt(List.of(userMessage), ChatOptions.builder().model("deepseek-v4-flash-vision-exp").build());
return this.chatModel.call(prompt).getResult().getOutput().getText();
}
输出结果
图片中是**北京天安门**。 这是位于中国北京市中心的标志性建筑,是明清两代皇城的正门。图片中可以看到它标志性的红墙、黄琉璃瓦重檐歇山顶、***画像,以及两侧的标语“中华人民共和国万岁”和“世界人民大团结万岁”。

浙公网安备 33010602011771号