过去,想体验大模型,几乎默认要连云端。
无论是聊天、识图、语音转文字,还是让模型根据提示完成任务,大多数应用背后都依赖远程服务器。用户输入的文本、图片、音频需要上传到云端,模型推理完成后再把结果返回手机。
这样做虽然模型能力强,但网络不好时体验会变差,涉及隐私数据时用户会有顾虑,开发者想快速验证端侧模型效果也不够方便。
尤其是在手机端,大模型部署一直给人一种“门槛很高”的感觉。需要关心模型格式、推理框架、量化、内存、GPU/NPU 加速、下载管理、前端交互等一整套工程问题。对普通用户来说,这太复杂。对开发者来说,这也不是一个可以随手验证的轻量入口。
今天要给大家介绍的开源项目 Gallery 正是为了解决这个问题而来。

它是Google AI Edge 团队专为移动端打造的GenAI展示与实验平台。用户不需要自己搭服务器,也不需要写复杂推理代码,只要安装 App、选择模型、下载到本机,就可以直接体验 AI Chat、图片问答、语音转写、Prompt Lab等能力,真正实现离线、私密、高性能的本地AI体验。目前,该项目在github上已收获 23k stars。

项目链接:
https://github.com/google-ai-edge/gallery
01
Gallery 把手机变成一个
本地大模型实验场
过去我们说端侧 AI,很多人想到的是相机美颜、语音唤醒、OCR、图片分类这类小模型任务。
但随着模型量化、移动端推理框架和硬件加速能力提升,手机本地运行生成式模型正在变得越来越现实。
Gallery 做的事情,就是把这些底层能力封装成一个普通用户和开发者都能上手的应用。
在医疗、办公、会议纪要、个人相册、企业内部资料等场景中,用户并不总是愿意把数据发到云端。Gallery 明确强调,模型推理发生在设备硬件上,不需要把提示词、图片或敏感数据发送到服务器。
当然,模型首次下载仍然需要网络。进入应用后,用户可以像逛模型商店一样选择模型。模型下载到本地后,就可以在不同任务入口中调用。
它特别适合做一些轻量但高频的本地任务。比如离线摘要一段文本、对现场照片进行说明、对会议录音做初步转写、让模型根据提示生成草稿,或者在没有网络的环境下提供基本智能交互。

很多模型论文或开源项目会给出 benchmark,但那些数据往往来自固定服务器、固定 GPU,和真实手机体验差距很大。
端侧 AI 最关键的问题不是模型在 A100 上跑得多快,而是它在我的手机上能不能跑、首 token 要等多久、持续生成速度如何、内存会不会爆。
Gallery 提供模型管理和 Benchmark 能力,用户可以直接在自己的设备上观察模型表现。

Google AI Edge 的 LiteRT-LM 文档还给出了 Gemma-4-E2B 在不同平台上的参考性能,例如 Android 设备、iPhone、macOS、Linux 以及 Raspberry Pi 等平台的 CPU/GPU 推理表现。

来源:
https://ai.google.dev/edge/litert-lm/overview?hl=zh-cn
说明 Google 正在把端侧大模型运行从“能跑”推进到“可比较、可调优、可工程化”。
02
使用方法
首先准备一台符合条件的设备,Android 需要 Android 12 及以上,iOS 需要 iOS 17 及以上。
直接在Google Play或App Store搜索“Google AI Edge Gallery”下载安装;Android用户也可从GitHub Releases下载APK。

链接:
https://github.com/google-ai-edge/gallery/releases/tag/1.0.13
03
下一轮 AI 应用的入口,
可能会重新回到设备本身
过去两年,大模型的竞争主线是云端算力与参数的军备竞赛——谁的参数更多、上下文更长、推理更强,谁就更容易成为焦点。
但当模型能力开始下沉到手机、PC、车机、AR眼镜乃至机器人时,竞争的逻辑正在悄然改变。
云端模型解决的是“最强大脑”的问题,而端侧模型解决的是“随身智能”的问题。
它不一定每次都比云端模型更聪明,但它可以更快、更私密、更低成本、更懂用户。它能直接调用手机的相机、麦克风、传感器和本地文件,能在完全断网的环境下稳定工作,能把大量高频、隐私敏感的任务留在设备本地,只把真正需要深度思考的问题抛给云端。
这也是 Google AI Edge Gallery 的真正意义。
它不是一个简单的 Demo 集合,而是在用实际产品告诉整个开发者生态:端侧 AI 的工程链路已经成熟。模型有了,高效运行时有了,硬件加速有了,完整可落地的移动端示例也有了。
接下来,真正的考验在于谁能把这些能力转化为真正好用、稳定、让人离不开的产品体验。
未来的 AI 应用,大概率不会是单一的“全能云端助手”,而会是云端 + 端侧深度协同的混合智能体。手机上的本地模型负责即时感知、隐私保护和低延迟交互;云端模型负责复杂推理、长上下文记忆和跨服务协作。二者并非替代,而是分工与共生。
从这个角度看,Gallery 更像是端侧智能时代的一块拼图。 它让普通用户很直观地感受到,原来手机本身也可以运行大模型。也让开发者看到,端侧 AI 不再只是论文里的概念,而是可以下载、安装、测试、改造、集成的真实工程。







