Transsion Ella Voice Assistant Article

传音集团手机端AI语音助手(Ella):从架构设计到端侧实现 #

作者: 大风
日期: 2026-08-02
系列: 手机端AI产品架构设计
关键词: 传音 · Ella语音助手 · 端侧大模型 · HiOS/itelOS/XOS · 小语种ASR · 离线AI · 新兴市场


一、行业背景与传音AI战略 #

1.1 传音集团概况与市场定位 #

传音控股,被称为"非洲手机之王",2025年全球手机出货量达1.69亿部,全球市占率12.3%排名第三。旗下拥有三大手机品牌:

品牌 定位 主要市场 操作系统
TECNO 中高端科技品牌 非洲、南亚、东南亚、拉美 HiOS
itel 入门级性价比品牌 非洲、南亚 itelOS
Infinix 年轻科技潮牌 非洲、南亚、东南亚 XOS

除手机外,传音还构建了完整的AIoT生态:

  • Boomplay — 非洲最大音乐流媒体平台之一,千万级MAU
  • AHA Games — 游戏中心,覆盖新兴市场游戏分发
  • Phone Master — 手机管家,装机必备工具
  • Palm Store — 本地化应用商店
  • Carlcare — 售后服务品牌,覆盖非洲50+国家
  • oraimo — 数码配件品牌(TWS耳机、智能音箱、移动电源等)
  • Syinix — 家用电器品牌

🖼 配图 1:传音集团品牌矩阵与市场分布图

graph TB
    subgraph 传音控股 Transsion
        TECNO[TECNO<br/>中高端]
        itel[itel<br/>入门级]
        Infinix[Infinix<br/>年轻科技]
    end
    
    subgraph AIoT生态
        Boomplay[Boomplay<br/>音乐]
        AHA[AHA Games<br/>游戏]
        PhoneM[Phone Master<br/>管家]
        Carl[Carlcare<br/>售后]
        orai[oraimo<br/>配件]
    end
    
    subgraph 自研OS
        HiOS[HiOS<br/>TECNO]
        itelOS[itelOS<br/>itel]
        XOS[XOS<br/>Infinix]
    end
    
    subgraph AI能力
        Ella[Ella语音助手]
        Qwen[通义千问]
        DS[DeepSeek-R1]
        AIKey[AI按键]
    end
    
    TECNO --> HiOS
    itel --> itelOS
    Infinix --> XOS
    HiOS --> Ella
    itelOS --> Ella
    XOS --> Ella
    Ella --> Qwen
    Ella --> DS
    Ella --> AIKey
    TECNO --> Boomplay
    itel --> AHA
    Infinix --> PhoneM
    TECNO --> Carl
    
    style Ella fill:#FF6B6B
    style Qwen fill:#4ECDC4
    style DS fill:#4ECDC4
    style AIKey fill:#FFEAA7

1.2 Ella语音助手:从离线助手到端侧Agent的演进 #

Ella是传音集团旗下各品牌手机的AI语音助手名称。它的演进路线深刻反映了传音在新兴市场的本地化创新路径:

代际 时间 形态 核心能力 局限
1.0 离线指令 2020-2022 端侧规则引擎 基础语音控制(打电话、发短信、播放音乐) 仅支持英语/法语/斯瓦希里语,指令有限,无法对话
2.0 离线+云端混合 2023-2024 端侧小语种ASR + 云端大模型 非洲小语种支持、离线翻译、简单对话 依赖网络,延迟高,弱网体验差
3.0 端侧大模型Agent 2025-至今 通义千问/DeepSeek端侧部署 离线多轮对话、AI按键一键唤醒、AI Writing、通话摘要 端侧算力受限,中低端机型适配挑战大

关键里程碑:

  • 2025.1 — 阿里云通义千问大模型搭载TECNO AI手机,基于联发科芯片深度优化
  • 2024 — Infinix手机品牌接入DeepSeek-R1满血版
  • 2025.3 — MWC 2026发布CAMON 50系列,首次搭载物理AI按键
  • 2025.6 — 新品搭载离线翻译和语音助手等多个AI功能
  • 2025.11 — 传音宣布启动香港IPO,募资10亿美元用于AI研发
  • WMT2025 — 国际机器翻译大赛四项冠军,成果已落地Ella

🖼 配图 2:Ella语音助手演进时间轴

timeline
    title Ella语音助手演进路线
    2020-2022 : 1.0 离线指令阶段
              : 端侧规则引擎
              : 基础语音控制
              : 3语言支持
    2023-2024 : 2.0 离线+云端混合
              : 小语种ASR突破
              : Infinix接入DeepSeek-R1
              : 离线翻译落地
    2025 : 3.0 端侧大模型Agent
         : 通义千问端侧部署
         : AI物理按键
         : WMT2025四冠
         : 港股IPO募资AI
    2026+ : 下一代Agent框架
          : 端到端语音大模型
          : AI眼镜语音交互
          : 100+语言覆盖

1.3 传音AI战略核心信息 #

硬件端:

  • AI物理按键:TECNO CAMON 50系列首次搭载,短按唤醒Ella、长按深度对话、双击一键问屏
  • 芯片适配:与联发科深度合作,在天玑9300/9400上部署通义千问;同时适配展锐低端芯片
  • 影像AI:AI RAW 2.0图像引擎、AI Auto Zoom等AI影像功能

软件端:

  • 大模型接入:通义千问 + DeepSeek-R1双引擎
  • Google Cloud合作:一键问屏、AI搜索、通话摘要、AI Writing
  • Agent框架:下一代Agent框架构建中
  • 小语种技术:WMT2025四冠,非洲/南亚50+语言覆盖

战略方向(竺兆江2025Q3业绩会披露):

“公司希望推动AI应用和AI终端技术在新兴市场的创新和普及,为消费者带来更优化、更智能的用户体验。”

1.4 岗位职责映射:架构师在传音语音助手中的核心定位 #

根据岗位需求,我们将架构师职责映射到Ella语音助手的具体模块:

职责要求 Ella对应模块 技术指标
系统架构规划与产品特性落地 Ella四层架构(感知→认知→决策→执行) 整体架构文档 + 技术方案
AI需求拆解为技术指标 小语种ASR准确率/离线可用性/低端机型适配SLA CER≤8%、延迟≤200ms、内存≤600MB
逻辑/技术架构方案输出 端云协同架构 + 端侧大模型部署方案 架构设计文档 + 部署方案
功能模块拆分与交付跟踪 Ella插件生态模块拆分 模块边界文档 + 交付标准
攻关复杂场景技术难题 非洲50+语言适配、低端机端侧推理、弱网/断网兜底 攻关报告 + 性能数据
追踪前沿技术推动迭代 Agent框架、端到端语音大模型、多模态融合 技术评估报告 + 路线图

二、总体架构设计 #

2.1 传音Ella语音助手架构设计三原则 #

┌───────────────────────────────────────────────────────────────┐
│              传音Ella语音助手架构设计三原则                      │
├─────────────────┬─────────────────┬───────────────────────────┤
│   稳健 Robust   │   前瞻 Forward   │      可扩展 Scalable       │
│                 │   Looking       │                            │
│ • 离线全可用     │ • Agent原生框架  │ • 1+N 插件架构              │
│ • 弱网强兜底     │ • 端到端语音模型  │ • 多芯片适配               │
│ • 低端机可用     │ • 多模态融合     │   (MTK/展锐/高通)           │
│ • 小语种优先     │ • 多品牌差异化   │ • 模型OTA热更新             │
│ • 隐私优先       │ • AIoT全场景     │ • 生态服务可扩展             │
└─────────────────┴─────────────────┴───────────────────────────┘

稳健(Robust) 是传音架构的第一原则。新兴市场网络基础设施薄弱,30%用户可能处于断网状态,40%处于2G/3G弱网。Ella必须做到离线全可用——核心语音识别、意图理解、手机操作在断网时100%可用。

前瞻(Forward Looking) 要求架构面向未来3-5年。Agent原生框架设计、端到端语音大模型预研、多模态AI眼镜语音交互集成,这些都是2026-2028年的技术方向,架构必须提前预留接口。

可扩展(Scalable) 体现在三个层面:芯片层面适配天玑/展锐/高通多平台,系统层面兼容HiOS/itelOS/XOS三套OS,生态层面支持Boomplay/AHA Games/Carlcare等自有服务以及第三方Agent接入。

2.2 四层架构总览(传音定制版) #

🖼 配图 3:Ella语音助手四层架构全景图

graph TB
    subgraph Layer1[用户交互层]
        AIKey[AI物理按键<br/>短按/长按/双击]
        Voice[语音输入<br/>50+语言]
        Touch[屏幕触摸<br/>一键问屏]
        Glasses[AI眼镜语音<br/>MWC 2026]
    end
    
    subgraph Layer2[感知层 Perception]
        KWS[多语种KWS<br/>50+语言唤醒]
        VAD[VAD语音活动检测]
        ASR[多语种ASR<br/>Paraformer/自研]
        NLU[语义理解<br/>意图识别]
        MultiModal[多模态融合<br/>语音+屏幕+传感器]
    end
    
    subgraph Layer3[认知层 Cognition]
        LLM[端侧LLM<br/>通义千问/DeepSeek]
        Trans[小语种翻译<br/>WMT冠军技术]
        Memory[上下文记忆<br/>端侧持久化]
        Emotion[情感理解<br/>语调/语义分析]
    end
    
    subgraph Layer4[决策层 Decision]
        Router[Intent路由<br/>端/云分发]
        Agent[Agent规划<br/>任务分解]
        FC[Function Calling<br/>工具调用]
        Guard[安全护栏<br/>权限/内容/幻觉]
    end
    
    subgraph Layer5[执行层 Execution]
        OSAPI[HiOS/itelOS/XOS API]
        AppDispatch[跨应用调度<br/>Intent转发]
        EcoTools[生态工具链<br/>Boomplay/AHA/Carlcare]
        Output[TTS语音反馈<br/>多语种]
    end
    
    subgraph External[外部增强]
        Cloud[Google Cloud<br/>云端增强]
        Qwen[阿里云通义千问<br/>云端大模型]
    end
    
    AIKey --> KWS
    Voice --> KWS
    Touch --> MultiModal
    Glasses --> Voice
    
    KWS --> VAD
    VAD --> ASR
    ASR --> NLU
    NLU --> MultiModal
    MultiModal --> LLM
    
    LLM --> Trans
    LLM --> Memory
    LLM --> Emotion
    
    LLM --> Router
    Router --> Agent
    Agent --> FC
    FC --> Guard
    
    Guard --> OSAPI
    OSAPI --> AppDispatch
    AppDispatch --> EcoTools
    EcoTools --> Output
    Output --> AIKey
    
    Router -.弱网/云端.-> Cloud
    LLM -.复杂推理.-> Qwen
    
    style Layer1 fill:#FFEAA7
    style Layer2 fill:#74B9FF
    style Layer3 fill:#A29BFE
    style Layer4 fill:#FD79A8
    style Layer5 fill:#55EFC4
    style External fill:#DFE6E9

2.3 端云协同架构(传音定制版) #

传音的端云协同架构必须深度适配新兴市场网络环境

网络环境 非洲用户占比 网络特征 Ella策略 可用能力
4G/WiFi稳定 ~30% 带宽充足,延迟<100ms 端云协同 全部能力,云端深度推理
2G/3G弱网 ~40% 带宽<1Mbps,延迟>500ms 端侧优先 端侧全量,云端降级为文本API
完全断网 ~30% 无网络连接 纯端侧 基础ASR+LLM+手机操作100%可用

🖼 配图 4:传音端云协同架构图

graph TB
    User[用户<br/>语音/按键输入] --> Perceive[感知层<br/>KWS → VAD → ASR → NLU]
    
    Perceive --> Router{端云路由器<br/>网络状态 + 任务复杂度}
    
    Router -->|断网| LocalOnly[纯端侧处理]
    Router -->|弱网| LocalFirst[端侧优先<br/>云端增强]
    Router -->|稳定网络| FullCloud[端云协同]
    
    LocalOnly --> LocalLLM[端侧LLM<br/>通义千问3B/DeepSeek蒸馏]
    LocalLLM --> LocalFC[端侧Function Calling]
    LocalFC --> LocalExec[端侧执行<br/>OS API + 生态服务]
    
    LocalFirst --> LocalLLM
    LocalFirst --> LightCloud[云端轻量API<br/>搜索增强/知识补充]
    LightCloud --> LocalExec
    
    FullCloud --> CloudLLM[云端大模型<br/>Google Cloud / 通义千问云端版]
    CloudLLM --> CloudExec[云端执行 + 端侧回调]
    
    LocalExec --> Feedback[TTS多语种语音输出]
    CloudExec --> Feedback
    Feedback --> User
    
    style LocalOnly fill:#55EFC4
    style LocalFirst fill:#FFEAA7
    style FullCloud fill:#74B9FF
    style Router fill:#FF6B6B

2.4 架构权衡:四维约束分析(传音场景) #

约束维度 传音目标 技术手段 挑战
功耗 ≤8W持续推理(中低端机型散热差) NPU加速 + 动态精度 + 休眠策略 itel入门机型无NPU,需CPU/GPU兜底
延迟 唤醒≤500ms(弱网容忍更高),TTS首字≤1s KV Cache + Speculative Decoding 小语种ASR延迟较高,需模型优化
精度 非洲语言ASR≥90%,主流语言≥97% 小语种微调模型 + 云端增强 50+语言覆盖难度大,低资源语言数据稀缺
隐私 用户数据不出端(新兴市场信任建立) 端侧处理 + 差分隐私 + 本地存储 个性化推荐和长期记忆受限
低端机适配 2GB RAM机型可用 模型蒸馏 + 4bit量化 + 分层加载 2GB内存下模型≤1GB,推理延迟≤250ms

关键设计决策:

  1. 小语种优先:与苹果/华为不同,传音必须优先保证非洲/南亚小语种的ASR准确率,这是核心竞争力
  2. 低端机兜底:itel品牌大量出货在$50-$100价位段,2GB RAM是常态,架构必须适配
  3. 离线第一:30%断网率意味着离线能力不是锦上添花,而是基本要求
  4. 隐私信任:新兴市场用户对数据隐私高度敏感,端侧处理是建立信任的关键

三、感知层设计:听清·听懂·多语种 #

3.1 多语种KWS + VAD:50+语言唤醒 #

传音语音助手的核心差异化竞争力之一是小语种支持。这是与Siri、小爱同学等国内语音助手最本质的区别。

语言覆盖策略:

语言类别 代表语言 用户量级 技术方案 优先级
主流语言 英语、法语、阿拉伯语 ~5亿 轻量KWS模型(<50M参数) P0
非洲大语种 斯瓦希里语、豪萨语、约鲁巴语、阿姆哈拉语 ~2亿 专用KWS模型 + 迁移学习 P0
南亚语言 乌尔都语、孟加拉语、印地语 ~5亿 多语种共享编码器 P1
东南亚语言 印尼语、马来语、他加禄语 ~3亿 迁移学习 + 数据增强 P1
拉美语言 西班牙语、葡萄牙语 ~3亿 复用主流语言模型 P2

性能指标:

指标 目标值 现状(主流语言) 现状(小语种) 技术方案
唤醒延迟 ≤500ms ~350ms ~450ms 端侧轻量KWS模型
误唤醒率 ≤2次/24h ~1.5次/24h ~1.8次/24h 多级验证:KWS → VAD → ASR
离线可用 全支持 纯端侧推理
功耗 ≤1.5%电池/天 ~1.2%电池/天 ~1.3%电池/天 DSP/NPU常驻监听

🖼 配图 5:感知层数据流时序图

sequenceDiagram
    participant User as 用户
    participant DSP as DSP/NPU<br/>低功耗常驻
    participant KWS as KWS引擎<br/>50+语言
    participant VAD as VAD检测
    participant ASR as ASR引擎<br/>多语种
    participant NLU as NLU<br/>意图理解
    participant LLM as 端侧LLM
    
    User->>DSP: 语音输入
    DSP->>DSP: 音频采集(16kHz/24bit)
    DSP->>KWS: 音频流输入
    KWS->>KWS: 50+语言唤醒词匹配
    KWS-->>User: 唤醒成功(震动+音效)
    
    KWS->>VAD: 激活语音活动检测
    VAD->>VAD: 检测语音起始/结束
    VAD->>ASR: 有效语音段输入
    
    ASR->>ASR: 多语种语音识别<br/>(语言自动检测)
    ASR->>NLU: 识别文本 + 置信度
    NLU->>LLM: 意图理解结果
    
    LLM->>LLM: 认知层处理...
    
    Note over DSP,KWS: KWS常驻功耗: ≤1.2%电池/天
    Note over ASR,LLM: ASR延迟: ~100ms<br/>NLU延迟: ~50ms

3.2 多语种ASR语音识别 #

ASR是感知层的核心。传音采用多模型并存策略,不同语言使用不同模型:

方案 适用语言 参数量 内存占用(4bit) 延迟(NPU) 准确率(CER) 部署状态
Paraformer-large 中文、英语 ~220M ~800MB ~120ms ≤2% ✅ 已部署
传音自研小语种ASR 斯瓦希里/豪萨/约鲁巴等 ~150M ~500MB ~100ms ≤8% ✅ 已部署
Whisper-tiny(多语言兜底) 50+语言 39M ~150MB ~80ms ≤15% ✅ 已部署

语言自动检测(LID)策略:

输入音频 → LID模型(轻量) → 判断语言类别
    ├── 中文/英语 → Paraformer-large
    ├── 斯瓦希里语/豪萨语 → 传音自研ASR
    └── 其他/未知 → Whisper-tiny兜底

🖼 配图 6:多语种ASR路由决策图

graph TD
    A[输入音频] --> B[LID轻量模型<br/>语言检测]
    B -->|中文| C[Paraformer-large]
    B -->|英语| C
    B -->|斯瓦希里语| D[传音自研ASR]
    B -->|豪萨语| D
    B -->|约鲁巴语| D
    B -->|阿姆哈拉语| D
    B -->|其他语言| E[Whisper-tiny兜底]
    B -->|未知语言| E
    
    C --> F[输出文本 + 置信度]
    D --> F
    E --> F
    
    F --> G{置信度 ≥ 85%?}
    G -->|是| H[送入NLU]
    G -->|否| I[请求云端ASR增强]
    I --> J[云端返回增强结果]
    J --> H
    
    style A fill:#FFEAA7
    style C fill:#4ECDC4
    style D fill:#4ECDC4
    style E fill:#FFEAA7
    style H fill:#95E1D3
    style I fill:#FF6B6B

3.3 多模态感知融合 #

Ella不仅听语音,还融合多种感知输入:

感知模态 输入源 用途
语音 麦克风阵列 核心交互方式
屏幕内容 屏幕截图/OCR 一键问屏、AI解读当前页面
传感器 加速度计/陀螺仪/GPS 场景感知(行走/驾车/静止)
AI眼镜 摄像头 + 麦克风 MWC 2026发布的AI眼镜语音交互
环境音 麦克风 环境场景识别(室内/户外/嘈杂)

四、认知层设计:端侧大模型核心 #

4.1 传音端侧LLM选型与部署 #

传音已接入两大基座模型,形成双引擎驱动

模型 基座 合作方式 端侧参数量 内存占用(4bit) 推理延迟(NPU) 适用场景
通义千问端侧版 Qwen2.5 与阿里云深度合作 3B ~1.8GB ~85ms 主流语言对话、AI写作
DeepSeek-R1端侧版 DeepSeek Infinix已接入满血版 7B→3B蒸馏 ~2.5GB ~150ms 深度推理、复杂任务
传音自研轻量模型 自研蒸馏 低端机适配 1B ~600MB ~40ms 低端机型、基础指令

关键合作成果(传音 × 阿里云):

在CAMON 50系列手机上,传音与阿里云基于联发科天玑9300芯片进行了大量技术创新,在模型瘦身、工具链优化、推理优化、内存优化等多个维度展开合作。借助阿里巴巴淘系最新开源的MNN-LLM大模型推理引擎的高效GPU加速能力,真正把大模型"装进"手机中。

部署策略:按机型分层

机型档次 代表品牌 RAM 部署模型 NPU 推理延迟
高端 TECNO CAMON 50 Ultra 8GB+ 通义千问3B + DeepSeek蒸馏 天玑9300 APU ~85ms
中端 Infinix Hot 40 6GB 通义千问3B 天玑8000 APU ~120ms
入门 itel RS4 2-4GB 传音自研1B 展锐T616无NPU ~250ms

4.2 “1+N” 架构:基础模型 + 场景插件 #

🖼 配图 7:Ella 1+N 架构设计图

graph TB
    subgraph 1[1 基础大模型]
        Base[通义千问3B / DeepSeek蒸馏版<br/>端侧推理引擎]
    end
    
    subgraph N[N 场景插件]
        Trans[小语种翻译<br/>WMT冠军技术]
        Write[AI写作<br/>邮件/短信/社媒文案]
        Summary[通话摘要<br/>自动总结通话]
        Search[AI搜索<br/>一键问屏]
        PhoneOp[手机操作<br/>打电话/发短信/开应用]
        Music[Boomplay音乐<br/>语音点播/推荐]
        Image[AI影像增强<br/>AI RAW 2.0]
        Game[AHA Games<br/>游戏辅助]
    end
    
    Base --> Trans
    Base --> Write
    Base --> Summary
    Base --> Search
    Base --> PhoneOp
    Base --> Music
    Base --> Image
    Base --> Game
    
    style Base fill:#FF6B6B
    style Trans fill:#4ECDC4
    style Write fill:#4ECDC4
    style Summary fill:#4ECDC4
    style Search fill:#4ECDC4
    style PhoneOp fill:#95E1D3
    style Music fill:#95E1D3
    style Image fill:#95E1D3
    style Game fill:#95E1D3

插件分类:

类别 插件 依赖 离线可用
AI核心 AI写作、通话摘要、AI搜索 端侧LLM
语言服务 小语种翻译(WMT技术) 端侧翻译模型
手机操作 打电话、发短信、开应用 Function Calling + OS API
生态服务 Boomplay音乐、AHA Games Boomplay/AHA API ❌ 需网络
影像增强 AI RAW 2.0 NPU图像处理

4.3 推理加速关键技术 #

技术 原理 加速效果 传音适配情况
MNN-LLM推理引擎 阿里淘系开源,高效GPU/NPU加速 3x vs 原生推理 ✅ 已部署(CAMON 50系列)
4bit AWQ量化 激活感知权重量化,保留重要通道精度 内存↓4倍,精度损失<2.3% ✅ 通义千问端侧版
KV Cache优化 KV Cache量化 + 压缩 + 局部-全局注意力 内存↓2倍 ✅ 已部署
Speculative Decoding 草稿模型预测 + 主模型验证 1.5-2x 加速,无损 🔄 规划中
NPU算子融合 注意力+FFN融合为单核,减少内存搬运 1.3-1.8x 加速 ✅ MediaTek NPU已适配
分层加载 核心层常驻内存,非核心层按需加载 内存↓50% ✅ 低端机适配

4.4 端侧个性化记忆 #

🖼 配图 8:端侧记忆管理架构图

graph TB
    subgraph 短期记忆 Session Memory
        SM[(会话上下文<br/>最近100轮对话)]
    end
    
    subgraph 中期记忆 Profile Memory
        PM[(用户画像<br/>偏好/习惯/常用语言)]
    end
    
    subgraph 长期记忆 Knowledge Memory
        KM[(用户知识库<br/>联系人/日程/笔记)]
    end
    
    subgraph 端侧存储
        SQLite[(SQLite 本地数据库<br/>加密存储)]
    end
    
    LLM[端侧LLM] --> SM
    SM --> PM
    PM --> KM
    SM --> SQLite
    PM --> SQLite
    KM --> SQLite
    
    SQLite -.云端同步.-> Cloud[(Google Cloud<br/>加密备份)]
    
    style SM fill:#FFEAA7
    style PM fill:#4ECDC4
    style KM fill:#A29BFE
    style SQLite fill:#55EFC4
    style Cloud fill:#DFE6E9

五、决策层设计 #

5.1 Intent路由与Agent规划 #

🖼 配图 9:Ella Intent路由决策树

graph TD
    A[用户语音输入<br/>NLU结果] --> B{端侧可处理?}
    
    B -->|是| C{任务类型}
    B -->|否| D[路由至云端<br/>Google Cloud]
    
    C -->|手机操作| E[Function Calling<br/>OS API调用]
    C -->|AI对话| F{对话复杂度}
    C -->|翻译| G[端侧翻译模型]
    C -->|AI写作| H[端侧LLM生成]
    C -->|音乐播放| I[Boomplay API]
    
    F -->|≤10轮| J[端侧LLM直接响应]
    F -->|>10轮| D
    
    D --> K[云端大模型推理]
    K --> L[返回结果到端侧]
    L --> M[端侧TTS输出]
    
    E --> N[执行结果反馈]
    G --> M
    H --> M
    I --> O[音乐播放]
    J --> M
    N --> M
    
    style A fill:#FFEAA7
    style B fill:#FF6B6B
    style D fill:#FF6B6B
    style J fill:#4ECDC4
    style M fill:#55EFC4

5.2 Function Calling 端侧实现 #

方案 参数量 适用场景 准确率 传音适配
通义千问内置FC 包含在3B模型中 已优化端侧FC 95%+ ✅ 已部署
FunctionGemma 270M 端侧函数调用(独立) 94%+ 🔄 评估中
云端FC兜底 复杂多步调用 98%+ ✅ Google Cloud

端侧FC调用示例:

{
  "intent": "send_message",
  "parameters": {
    "contact": "Mom",
    "message": "I'll be home late today",
    "language": "swahili"
  },
  "confidence": 0.96,
  "execution": "local"
}

5.3 Agent框架设计(传音下一代) #

根据竺兆江2025Q3业绩会披露,传音正在构建下一代Agent框架:

🖼 配图 10:Ella Agent框架时序图

sequenceDiagram
    participant User as 用户
    participant Ella as Ella Agent<br/>Orchestrator
    participant Planner as 规划Agent
    participant TransAgent as 翻译Agent
    participant PhoneAgent as 手机操作Agent
    participant SearchAgent as AI搜索Agent
    participant EcoAgent as 生态服务Agent
    
    User->>Ella: 复杂语音指令<br/>"帮我查一下明天天气,然后给Mom发个消息"
    Ella->>Ella: Intent解析 + 任务分解
    Ella->>Planner: 任务规划
    Planner->>Planner: 分解为2个子任务
    
    Planner->>SearchAgent: 子任务1: 查询明天天气
    SearchAgent->>SearchAgent: 调用天气API(云端)
    SearchAgent-->>Planner: 返回天气结果
    
    Planner->>PhoneAgent: 子任务2: 给Mom发消息
    PhoneAgent->>PhoneAgent: Function Calling<br/>OS API调用
    PhoneAgent-->>Planner: 消息发送成功
    
    Planner-->>Ella: 全部子任务完成
    Ella->>Ella: 结果汇总
    Ella->>User: TTS多语种语音反馈<br/>"明天天气晴,消息已发送"

5.4 安全护栏设计 #

护栏类型 机制 传音场景特点
权限护栏 HiOS/itelOS/XOS级权限校验 新兴市场用户对隐私敏感,需明确授权
内容护栏 端侧安全分类器 + 多语言内容审核 50+语言内容安全检测是挑战
幻觉护栏 事实核查 + 置信度阈值 低于阈值时转云端Google Cloud
操作护栏 支付/删除等敏感操作二次确认 新兴市场价格敏感,误操作成本高
合规护栏 本地法律法规适配 各国数据保护法差异大

六、执行层设计 #

6.1 传音OS系统API集成 #

传音拥有三套自研OS,Ella需要适配每套OS的API能力:

OS 品牌 API集成范围 特点
HiOS TECNO 电话/短信/相机/日历/导航/设置/文件管理 中高端机型,API最全
itelOS itel 电话/短信/基础应用 入门机型,API精简,保证核心功能
XOS Infinix 电话/短信/相机/游戏/导航 年轻用户,游戏API增强

6.2 传音生态跨应用调度 #

🖼 配图 11:Ella执行层生态集成图

graph TB
    subgraph Ella执行引擎
        Guard[安全护栏<br/>权限校验]
        FC[Function Calling<br/>工具调度]
    end
    
    subgraph 传音自有生态
        Boomplay[Boomplay<br/>音乐流媒体<br/>千万级MAU]
        AHA[AHA Games<br/>游戏中心]
        PhoneM[Phone Master<br/>手机管家]
        Palm[Palm Store<br/>应用商店]
        Carl[Carlcare<br/>售后服务]
    end
    
    subgraph OS系统能力
        Phone[电话/短信]
        Camera[相机/相册]
        Calendar[日历]
        Settings[系统设置]
    end
    
    subgraph 第三方服务
        WhatsApp[WhatsApp]
        Maps[地图导航]
        Browser[浏览器]
    end
    
    Guard --> FC
    FC --> Boomplay
    FC --> AHA
    FC --> PhoneM
    FC --> Palm
    FC --> Carl
    FC --> Phone
    FC --> Camera
    FC --> Calendar
    FC --> Settings
    FC --> WhatsApp
    FC --> Maps
    FC --> Browser
    
    style Ella执行引擎 fill:#FF6B6B
    style Boomplay fill:#4ECDC4
    style Phone fill:#95E1D3
    style WhatsApp fill:#DFE6E9

生态服务集成详情:

生态服务 类型 Ella集成方式 用户场景
Boomplay 音乐流媒体 语音点播、歌词翻译、音乐推荐 “播放Burna Boy的歌”
AHA Games 游戏中心 语音启动游戏、游戏内辅助 “打开Free Fire”
Phone Master 手机管家 语音清理垃圾、优化内存 “清理手机垃圾”
Palm Store 应用商店 语音搜索下载应用 “下载TikTok”
Carlcare 售后服务 语音报修、服务预约 “我的手机屏幕坏了”
oraimo 数码配件 TWS耳机控制、音箱播放 “连接我的耳机”

6.3 AI按键与多入口设计 #

TECNO CAMON 50系列首次搭载物理AI按键,这是传音AI手机的标志性创新:

🖼 配图 12:AI按键多入口交互流程图

stateDiagram-v2
    [*] --> 待机
    
    待机 --> 短按AI键: 短按
    短按 --> Ella唤醒: 语音输入
    Ella唤醒 --> 语音交互: 正常对话
    语音交互 --> 待机: 完成/超时
    
    待机 --> 长按AI键: 长按
    长按 --> 深度对话: AI深度模式
    深度对话 --> 复杂推理: 调用端侧/云端LLM
    复杂推理 --> 待机: 完成/超时
    
    待机 --> 双击AI键: 双击
    双击 --> 一键问屏: 屏幕内容AI解读
    一键问屏 --> 屏幕分析: OCR + LLM分析
    屏幕分析 --> 待机: 完成/超时
    
    待机 --> 语音唤醒: 说出唤醒词
    语音唤醒 --> Ella唤醒: KWS匹配成功

AI按键交互规范:

操作 触发 行为 反馈
短按 按一次AI键 唤醒Ella,进入语音交互 震动 + 音效
长按 按住>1s 进入AI深度对话模式 持续震动 + 呼吸灯
双击 快速按两次 一键问屏,AI解读当前屏幕 截图动画 + 分析进度
语音唤醒 说出"Ella" KWS匹配成功自动唤醒 音效

七、端云协同架构详解 #

7.1 端侧 vs 云端分工矩阵(传音版) #

能力 端侧 Google Cloud 说明
KWS唤醒 必须端侧,50+语言,低功耗常驻
基础ASR 增强 端侧兜底,云端提升精度(低置信度时)
小语种翻译 WMT冠军技术,端侧优先
简单意图 打电话、发短信等本地操作
AI写作 增强 端侧生成,云端润色
复杂推理 降级 需要大算力的推理任务转云端
AI搜索 有限 云端实时搜索 + 端侧摘要
多轮深度对话 有限(10轮) 100轮以上转云端
个性化记忆 同步备份 端侧为主,云端加密备份
情感语音合成 增强 端侧基础TTS,云端高质量音色

7.2 端云路由策略 #

🖼 配图 13:传音端云路由决策流程图

graph TD
    A[用户输入] --> B{网络状态?}
    
    B -->|断网| C[纯端侧处理]
    B -->|弱网<br/>2G/3G| D{任务复杂度}
    B -->|稳定网络<br/>4G/WiFi| E{任务复杂度}
    
    D -->|简单| C
    D -->|中等| F[端侧处理 +<br/>云端轻量API]
    D -->|复杂| G[端侧LLM +<br/>云端增强]
    
    E -->|简单| C
    E -->|中等| G
    E -->|复杂| H[完整端云协同<br/>云端深度推理]
    
    C --> I[端侧TTS输出]
    F --> I
    G --> I
    H --> I
    
    style C fill:#55EFC4
    style F fill:#FFEAA7
    style G fill:#74B9FF
    style H fill:#A29BFE
    style I fill:#95E1D3

7.3 降级策略:弱网/断网兜底保障 #

这是传音架构的核心竞争力之一。在非洲、南亚等新兴市场,70%的用户可能处于弱网或断网状态

网络状态 用户占比(非洲) 可用能力 降级策略 用户体验
4G/WiFi稳定 ~30% 全部能力 端云协同,云端增强推理 完整体验
2G/3G弱网 ~40% 端侧全量 + 云端文本API 优先端侧,云端仅用于搜索增强 80%体验
完全断网 ~30% 端侧基础能力 纯端侧运行,离线指令100%可用 70%体验

断网时仍可用的核心能力:

  • ✅ 语音唤醒(50+语言KWS)
  • ✅ 基础ASR识别
  • ✅ 端侧LLM多轮对话(10轮以内)
  • ✅ 小语种翻译
  • ✅ 手机操作(打电话、发短信、开应用、设闹钟等)
  • ✅ AI写作(基础版本)
  • ✅ 通话摘要
  • ❌ AI搜索(需网络)
  • ❌ Boomplay音乐点播(需网络)
  • ❌ 复杂推理(需云端大算力)

八、工程实现与部署 #

8.1 芯片与推理框架适配(传音机型矩阵) #

传音的机型覆盖从$50到$500+的宽价位段,芯片平台多样:

芯片平台 代表机型 价格段 NPU 推理框架 典型延迟
MediaTek天玑9300/9400 CAMON 50 Ultra $400+ APU 37 TOPS MNN-LLM + NPU ~85ms
MediaTek天玑8000系列 CAMON 50 标准版 $200-400 APU 16 TOPS MNN-LLM + NPU ~120ms
Qualcomm骁龙 Infinix GT系列 $200-300 Hexagon NPU QNN / MNN-LLM ~90ms
Unisoc展锐T616/T606 itel A系列 $50-100 无独立NPU MNN-LLM (GPU/CPU) ~250ms
Unisoc展锐T310 itel入门款 $50以下 无独立NPU MNN-LLM (CPU only) ~350ms

关键发现: 传音大量出货机型(itel品牌)使用的是无NPU的展锐芯片,这意味着推理必须依赖CPU/GPU,延迟和功耗是巨大挑战。

8.2 分层部署策略 #

🖼 配图 14:传音机型分层部署策略图

graph TB
    subgraph 高端机型 TECNO CAMON 50系列
        H1[通义千问3B<br/>4bit量化]
        H2[DeepSeek蒸馏版]
        H3[完整插件生态]
        H1 --> H2
        H2 --> H3
    end
    
    subgraph 中端机型 Infinix Hot系列
        M1[通义千问3B<br/>4bit量化]
        M2[基础插件生态]
        M1 --> M2
    end
    
    subgraph 入门机型 itel A系列
        L1[自研轻量模型1B<br/>4bit量化]
        L2[核心插件<br/>手机操作/翻译]
        L1 --> L2
    end
    
    style H1 fill:#FF6B6B
    style M1 fill:#4ECDC4
    style L1 fill:#95E1D3

8.3 低端机适配策略(2GB RAM挑战) #

这是传音区别于苹果/三星的核心技术挑战。itel品牌大量出货在$50-$100价位段,2GB RAM是常态。

挑战 传音方案 效果
2GB内存限制 模型≤600MB(1B参数,4bit量化) 低端机可用,推理延迟≤250ms
无独立NPU GPU加速 + CPU NEON优化 推理可行,功耗可控
存储有限(32GB) 模型按需下载,云端OTA 初始安装≤100MB
散热能力弱 动态降频 + 推理限流 温度≤40°C
电池容量小 智能休眠策略 待机功耗<1%

低端机模型瘦身方案:

原始模型: 7B参数 → 蒸馏到3B → 4bit AWQ量化 → 1.8GB
                              → 继续蒸馏到1B → 4bit量化 → 600MB ✅
                              适用于2GB RAM机型

8.4 功耗与热管理 #

策略 触发条件 动作 效果
动态精度 温度>38°C(中低端机阈值更低) FP16 → INT8 功耗↓30%
帧率降低 连续推理>20s token生成速率↓50% 温度↓5°C
休眠策略 无交互>3min NPU/GPU进入低功耗 功耗↓90%
模型切换 温度>42°C 大模型→轻量模型 功耗↓50%

九、关键技术攻关 #

9.1 攻关1:小语种ASR准确率从82%→92% #

小语种ASR是传音的核心竞争力,也是最大技术挑战。

阶段 优化手段 斯瓦希里语CER 豪萨语CER 累计优化
基线 Whisper-tiny 18% (82%) 22% (78%)
Step 1 传音小语种数据集(10000小时) 14% (86%) 17% (83%) -22%
Step 2 迁移学习 + 数据增强 11% (89%) 13% (87%) -39%
Step 3 端到端微调(Paraformer架构) 9% (91%) 11% (89%) -50%
Step 4 多语种联合训练 8% (92%) 10% (90%) -56%

🖼 配图 15:小语种ASR优化瀑布图

小语种ASR准确率优化瀑布图 (斯瓦希里语)

基线 Whisper-tiny          ████████████████████████████████████████  82%
+ 传音数据集(10000h)        ████████████████████████████████████████████████  86%
+ 迁移学习+数据增强         █████████████████████████████████████████████████████████  89%
+ 端到端微调(Paraformer)    ████████████████████████████████████████████████████████████████  91%
+ 多语种联合训练            ██████████████████████████████████████████████████████████████████████  92%

目标: 95%  ← 仍需提升3%

9.2 攻关2:低端机(2GB RAM)端侧推理延迟从350ms→200ms #

阶段 优化手段 延迟 累计优化
基线 CPU推理 1B模型 350ms
Step 1 GPU加速(MNN-LLM) 280ms -20%
Step 2 CPU NEON优化 250ms -29%
Step 3 KV Cache压缩 220ms -37%
Step 4 算子融合 + 内存复用 200ms -43%

9.3 攻关3:离线多轮对话100轮无卡顿 #

阶段 优化手段 100轮内存占用 卡顿率
基线 完整KV Cache 800MB 35%
Step 1 KV Cache量化(INT8) 400MB 20%
Step 2 局部-全局注意力 250MB 12%
Step 3 历史摘要压缩 150MB 5%
Step 4 滑动窗口 + 记忆检索 100MB <1%

9.4 攻关4:AI按键端到端延迟优化(500ms→200ms) #

阶段 优化手段 端到端延迟 优化
基线 按键→系统→Ella→响应 500ms
Step 1 KWS常驻DSP 400ms -20%
Step 2 Ella预加载到内存 300ms -40%
Step 3 异步推理流水线 250ms -50%
Step 4 NPU推理加速 200ms -60%

十、未来演进路线 #

10.1 2026:Ella Agent框架量产 #

  • 下一代Agent框架正式落地,支持多Agent协作
  • AI按键全面普及至TECNO全系
  • 多模态AI眼镜(MWC 2026已发布)语音交互集成
  • 端侧大模型升级至5B参数(高端机型)

10.2 2027:端到端语音大模型 #

  • 端到端语音→语音大模型(跳过文本中间态)
  • 100+语言覆盖,包括非洲少数民族语言
  • 情感语音合成(TTS)支持小语种
  • 跨设备Agent协作(手机+眼镜+音箱)

10.3 2028+:Agent生态与服务分发网络 #

  • 第三方Agent接入Ella平台
  • 新兴市场服务分发网络(本地商户/政府服务/金融服务)
  • AIoT全场景联动(手机+眼镜+音箱+家电)
  • 主动智能服务(基于用户行为的预判式服务)

🖼 配图 16:Ella技术演进路线图

gantt
    title Ella语音助手技术演进路线图
    dateFormat  YYYY-Q
    axisFormat  %Y Q%q
    
    section 2025
    通义千问端侧部署          :done, 2025-Q1, 2025-Q4
    AI物理按键(CAMON 50)      :done, 2025-Q2, 2025-Q3
    WMT2025四冠落地           :done, 2025-Q3, 2025-Q4
    离线多轮对话              :done, 2025-Q2, 2025-Q4
    
    section 2026
    下一代Agent框架           :active, 2026-Q1, 2026-Q4
    AI按键全系普及            :2026-Q1, 2026-Q3
    AI眼镜语音集成            :2026-Q2, 2026-Q4
    端侧5B模型(高端)          :2026-Q3, 2026-Q4
    
    section 2027
    端到端语音大模型          :2027-Q1, 2027-Q4
    100+语言覆盖              :2027-Q1, 2027-Q3
    情感TTS小语种             :2027-Q2, 2027-Q4
    跨设备Agent协作           :2027-Q3, 2027-Q4
    
    section 2028+
    第三方Agent平台           :2028-Q1, 2028-Q4
    新兴市场服务分发网络      :2028-Q1, 2028-Q4
    AIoT全场景联动            :2028-Q2, 2028-Q4
    主动智能服务              :2028-Q3, 2028-Q4

附录 #

A. 传音Ella语音助手关键术语表 #

术语 说明
Ella 传音集团AI语音助手名称,搭载于TECNO/Infinix/itel全系
HiOS TECNO品牌智能操作系统,基于Android深度定制
itelOS itel品牌智能操作系统,面向入门级市场
XOS Infinix品牌智能操作系统,面向年轻用户
传音OS HiOS + itelOS + XOS的统称
MNN-LLM 阿里巴巴淘系开源的大模型推理引擎,传音端侧部署核心框架
AI按键 TECNO CAMON 50系列首次搭载的物理AI按键
一键问屏 传音AI功能,双击AI键调用AI解读屏幕内容
Boomplay 传音旗下音乐流媒体平台,非洲最大音乐平台之一
Carlcare 传音旗下售后服务品牌,覆盖非洲50+国家
KWS Keyword Spotting,关键词唤醒检测
VAD Voice Activity Detection,语音活动检测
ASR Automatic Speech Recognition,自动语音识别
CER Character Error Rate,字符错误率
AWQ Activation-aware Weight Quantization,激活感知权重量化

B. 参考信息 #

  • 传音控股港股IPO招股书(2025.12)
  • 竺兆江2025Q3业绩说明会
  • MWC 2026 TECNO生态发布会(CAMON 50系列)
  • 传音 × 阿里云通义千问合作(2025.1)
  • Infinix接入DeepSeek-R1满血版(2024)
  • WMT2025国际机器翻译大赛四项冠军
  • IDC全球手机季度跟踪报告(2025)
  • 南都记者报道:传音搭载通义千问大模型(2025.1.7)

C. 性能测试环境 #

测试项目 测试机型 芯片 内存 OS 结果
端侧LLM推理 TECNO CAMON 50 Ultra 天玑9300 8GB HiOS 14 ~85ms/token
低端机适配 itel RS4 展锐T616 2GB itelOS 13 ~250ms/token
多语种ASR Infinix Hot 40 天玑8000 6GB XOS 13 斯瓦希里语92%
离线多轮对话 TECNO CAMON 50 天玑8000 6GB HiOS 14 100轮无卡顿
AI按键延迟 TECNO CAMON 50 Ultra 天玑9300 8GB HiOS 14 ~200ms

全文完。