01
iOS / Core ML 端侧推理
模型体积、Core ML、ANE/NPU、内存、首 Token 延迟和 App 生命周期。
从 iOS / Android 的模型运行、量化和硬件能力,到持续性能、发热、电量、隐私与产品路由。这里关注的不是“模型能不能跑”,而是它是否值得进入真实 App。
⌕搜索 Core ML、ONNX、llama.cpp、量化、发热、性能或端侧集成问题…模型体积、Core ML、ANE/NPU、内存、首 Token 延迟和 App 生命周期。
ONNX Runtime、NNAPI / NPU、设备差异、量化和 APK 体积。
GGUF、量化、上下文、CPU/GPU/NPU 资源和离线运行边界。
不是只看 tokens/s;还要看持续负载、热降频、电池消耗和交互流畅度。
什么数据应该留在设备、什么任务仍需要云端,以及本地模型真正带来的隐私收益。
同一套 App 根据设备能力选择小模型、大模型或云端模型,避免低端设备被强行拖慢。