Vincent's Essays

博客园 首页 新随笔 联系 订阅 管理

2026年6月14日 #

摘要: Memoria 开发记录 23:跨平台不是“编译通过”——Flutter 端侧 AI 的边界治理 前言 Flutter 能复用 UI 和大量业务逻辑,但端侧 AI 相册涉及照片权限、后台任务、原生推理库、文件访问、通知和数据库目录,这些能力在 Android、iOS、macOS 上都有不同约束。 因 阅读全文
posted @ 2026-06-14 23:22 Vincentson 阅读(7) 评论(0) 推荐(0)

摘要: Memoria 开发记录 24:标签不是关键词表——MobileCLIP 粗分类、细分类与可达性 前言 相册自动标签看起来像是维护一个关键词列表:为每个标签生成文本向量,再与图片向量比较。但当标签数量增加到几十甚至上百个时,直接全量比较会产生大量误命中,而且相近标签之间难以建立稳定阈值。 Memor 阅读全文
posted @ 2026-06-14 23:22 Vincentson 阅读(6) 评论(0) 推荐(0)

摘要: Memoria 开发记录 22:从生成到交付——视频导出、缓存与分享链路 前言 故事视频生成完成,并不意味着功能已经完成。用户真正关心的是:能否马上播放、能否找到导出文件、能否直接分享、下次打开是否还需要重新生成,以及失败后是否能继续。 Memoria 的视频能力从离屏渲染逐步扩展到缓存管理、导出管 阅读全文
posted @ 2026-06-14 23:21 Vincentson 阅读(11) 评论(0) 推荐(0)

摘要: Memoria 开发记录 19:让视频进入语义搜索——抽帧、去重与代表向量 前言 图片语义搜索相对直接:读取一张图片,生成一个向量,然后与文本向量比较。视频却是一段随时间变化的内容。如果只使用封面,可能完全错过后半段的重要场景;如果对每一帧生成向量,计算和存储成本又无法接受。 Memoria 对视频 阅读全文
posted @ 2026-06-14 23:21 Vincentson 阅读(27) 评论(0) 推荐(0)

摘要: Memoria 开发记录 18:相似人脸不等于同一个人——身份聚类、向量索引与错误合并 前言 人物相册的目标不是找出“画面里有人”,而是把同一个人在不同时间、光照、表情和角度下的照片聚合起来。这个任务比普通图片分类更敏感:把同一个人拆成多个簇会显得混乱,把两个不同的人合并到一起则会直接破坏用户信任。 阅读全文
posted @ 2026-06-14 23:21 Vincentson 阅读(13) 评论(0) 推荐(0)

摘要: Memoria 开发记录 17:大模型不是普通应用资源——权重下载、暂停恢复与状态快照 前言 端侧 AI 模型常常有几十 MB,视觉语言模型甚至可能达到数 GB。把所有权重直接打进安装包,会显著增加下载和更新成本;完全依赖运行时下载,又会遇到网络中断、空间不足、重复下载和版本不一致。 因此,模型权重 阅读全文
posted @ 2026-06-14 23:20 Vincentson 阅读(14) 评论(0) 推荐(0)

摘要: Memoria 开发记录 16:相册为什么会卡——缩略图索引、渐进加载与滚动性能 前言 相册页面看似只是一个图片网格,却是移动应用中最容易出现性能问题的界面之一。用户可能拥有数万张照片,每张原图又有数 MB。如果网格中的每个小格都读取原图、解码全分辨率像素,即使最终只显示 120 像素宽,也会造成巨 阅读全文
posted @ 2026-06-14 23:20 Vincentson 阅读(18) 评论(0) 推荐(0)

摘要: Memoria 开发记录 15:从编译开关到运行时设置——端侧 AI 能力如何真正交给用户 前言 端侧 AI 应用经常用编译参数控制功能,例如构建时决定是否启用 OCR、是否执行人脸分析、选择哪个推理后端。这种方式对开发测试很方便,却不适合真正的产品:普通用户不会为了关闭 OCR 重新安装一个 AP 阅读全文
posted @ 2026-06-14 23:20 Vincentson 阅读(10) 评论(0) 推荐(0)

摘要: Memoria 开发记录 14:让故事可以重现——从临时缓存到可复现的数字资产 前言 Memoria 不只是浏览照片,还会把照片、音乐、节拍和渲染参数组合成故事视频。早期实现中,导出结果和音乐主要依赖文件路径与缓存目录。这样的方案在一次运行中可用,但应用清理缓存、路径变化或设备重启后,故事就可能无法 阅读全文
posted @ 2026-06-14 23:20 Vincentson 阅读(11) 评论(0) 推荐(0)

摘要: Memoria 开发记录 13:端侧 VLM 演进——从原生桥接实验到可复用媒体描述服务 前言 视觉语言模型(VLM)能够把图片转换为自然语言描述,是相册故事生成的重要基础。传统标签只能说明“海边、人物、日落”,而 VLM 可以进一步描述“几个人在傍晚的海边散步”,为标题、旁白和故事结构提供更丰富的 阅读全文
posted @ 2026-06-14 23:20 Vincentson 阅读(9) 评论(0) 推荐(0)