雨晴LLM是一款专为安卓设备打造的本地离线大模型推理工具,也可以理解为移动端AI推理服务器,主打断网本地运行大语言模型,面向AI爱好者、重视对话隐私的用户,把安卓手机变成私人离线AI工作站。软件本体安装包体积小巧,软件本身不自带完整大模型权重,模型文件需要用户自行下载导入使用。

软件介绍
一个纯离线的Android本地LLM推理服务器。集成GoogleLiteRT-LM引擎运行Gemma模型,通过NanoHTTPd在127.0.0.1广播OpenAI兼容API,供ChatBox、OpenWebUI等第三方AI客户端调用。
功能特性

首次使用
打开App,进入「模型管理」标签页
下载一个模型(推荐Gemma4-E2B,约2.58GB)
切回「主控台」,点击「启动服务」
服务运行在http://127.0.0.1:8080
ARM64环境说明(非必需)
雨晴LLM怎么使用
1、打开雨晴LLM软件,在主控台界面,点击去授权,授予存储、后台悬浮窗、后台运行权限

2、点击最下方的模型界面

3、点击任意Gemma大模型,等待下载完成即可(也可以点击右上角的导入模型,选择本地已有的大模型文件,然后等待上传成功即可使用)

4、点击右下角设置,填写端口、完成模型相关设置,即可启动本地API服务

🔒 安全说明
✅ 服务器绑定 127.0.0.1,仅限本机访问
✅ allowBackup="false",拒绝应用数据被备份
✅ 纯离线运行,零网络请求(模型下载除外)
✅ 签名密钥由 GitHub Actions 在 CI 中安全生成并发布 Release APK
✅ 请求体大小限制 10MB,防止超大请求导致 OOM
✅ 请求日志只存摘要(多模态 Base64 数据不进日志),日志上限 100 条
✅ 空闲超时自动休眠引擎,推理中不会触发休眠(activeRequests 保护)
✅ 模型导入文件名规范化 + canonicalPath 校验,防止路径穿越
⚠️ tool_choice 支持 auto / none,required 和指定函数返回 400(LiteRT-LM 0.14.0 限制)
注意事项

雨晴LLM常规问题
1、运行雨晴LLM需要联网吗?
不需要,本地离线推理,模型跑在手机上,不会上传数据。
2、模型文件是自带的吗?
不是,需要你自行下载导入开源模型权重,支持多种参数量。
3、悬浮窗口不显示怎么办?
检查是否授予悬浮窗权限,同时不要被系统后台清理。
4、推理速度很慢怎么优化?
可以切换GPU后端,降低模型参数量,减少手机后台占用。
5、其他AI客户端怎么接入?
启动服务后,在支持OpenAI接口的客户端填入对应地址即可连接。
关于
RainyLLM由雨晴喵与水晴共同打造,属于「雨晴系列」工具之一:
RainyScanner—不拦截不跳转的Android扫码工具
Rainy2FA—纯本地生物识别保护的TOTP验证器
RainyLLM—本地LLM推理服务器(本项目)
📖 适用场景
隐私文字处理:私密笔记、个人思考记录,不想内容上传云端 AI;
无网络环境使用:外出无信号场景,离线 AI 问答、写文案;
AI 技术玩家调试:本地测试大模型、对接第三方 AI 客户端、搭建简易本地 AI 自动化流程;
学习辅助:文本总结、翻译辅助、构思作文、代码片段调试。
⚖️ 优缺点测评
优点
完全离线,隐私性强,不消耗网络流量;
API 开放,扩展性强,可以搭配多款第三方 AI 前端使用;
轻量 APP 本体,对设备兼容性广,高低配安卓手机都能尝试;
参数可调,可视化性能监控,上手调试门槛低。
缺点
模型文件需要单独下载,大参数量模型占用手机存储空间很高;
手机硬件直接决定推理速度,低配手机加载大模型会出现卡顿、生成缓慢;
移动端本地模型能力上限有限,复杂逻辑、长文本深度推理效果不如云端大模型;
长时间后台推理会增加手机耗电、发热。
⚠️ 注意事项
软件属于本地模型推理工具,本身不含大模型,需要自行获取合规模型权重文件导入;
在局域网开放 API 接口时注意网络安全,避免公网暴露推理服务;
手机内存不足时,加载大容量模型容易闪退,建议预留足够存储空间与运行内存;
生成内容仅供学习、个人测试参考,不能直接当作专业权威结论。
适合人群
AI 技术爱好者、注重隐私的文字创作者、经常处于无网络环境的用户、想要低成本体验端侧本地大模型的玩家。
更新日志
v1.0.0版本
修复了一些问题
| 厂商名称 | |
| 包名 | com.rainyllm.app |
| 名称 | 雨晴 LLM |
| 版本 | 1.0.0 |
| MD5 | b8eb171b59e93be8fba9214f84783ba6 |
| 性质 | 国产软件 |
| 授权 | 免费软件 |
| 语言 | 中文 |

















