Spring Ai超简单教程系列 - 05多模态

在网上找了一些Spring AI相关的教程,因为官方API更新较快的原因,大部分教程的内容都已过时。所以在参照官方参考文档学习的同时,沉淀每篇文章,为同样热爱学习的你,提供参考。
本系列教程参考Spring AI官方1.1.x版本文档:https://docs.spring.io/spring-ai/reference/1.1/index.html

多模态

多模态是指大模型能够同时理解和处理不同类型的输入信息,包括文本、图像、音频以及其他数据格式。
这里我们识别图片内容为例,展示多模态资源调用大模型的过程:

示例图片

在项目/resources/ststic/目录下放一个图片:
image

多模态调用代码:

@GetMapping("/ai/multimodality")
String explainImage() {
    ClassPathResource imageResource = new ClassPathResource("/static/tiananmen.jpeg");
    UserMessage userMessage = UserMessage.builder()
            .text("图片中是哪个地方?")
            .media(new Media(MimeTypeUtils.IMAGE_JPEG, imageResource))
            .build();
    Prompt prompt = new Prompt(List.of(userMessage), ChatOptions.builder().model("deepseek-v4-flash-vision-exp").build());

    return this.chatModel.call(prompt).getResult().getOutput().getText();
}

输出结果

图片中是**北京天安门**。 这是位于中国北京市中心的标志性建筑,是明清两代皇城的正门。图片中可以看到它标志性的红墙、黄琉璃瓦重檐歇山顶、***画像,以及两侧的标语“中华人民共和国万岁”和“世界人民大团结万岁”。
posted @ 2026-09-08 10:37  codest  阅读(9)  评论(0)    收藏  举报