使用 Gemini 打造能一键启用的高性能 AI 语音助手,接收第一个词元只需要 0.23 秒
运用 Agent Development Kit 快速开发并部署图生视频子 Agent
为新兴市场的用户提供本地化、便利的多模态 AI 功能
应用 Google Cloud Global Front End 在移动网络较复杂的区域实现快速、安全的数据和 API 呼叫传递
运用 Google Cloud 的 AI 技术和基础设施,传音在数字设备上打造了面向全球各地用户的新一代智能体验。
作为新兴市场的智能终端与数字服务领导者,传音(Transsion)旗下有多个知名手机品牌,业务遍及非洲、东南亚、南亚、中东和拉美等 70 多个国家和地区。据 IDC 数据,2024 年,传音智能机在全球市场的占有率为 8.7%,排名第四。
传音自成立以来便致力于为全球用户提供前沿技术,不断在其数字设备上开发易于使用的创新 AI 功能。随着 AI 浪潮进入第三次质变,传音的开发工作有了新的目标——打造一个会主动思考、能自动执行任务的下一代 AI 智能生态。
“传音 AI 手机的愿景,就是像人一样主动思考,像机器一样自动执行,端到端解决任务。”传音 TEX AI 中心总经理史团委解释。“以往用户有想法,需要找到工具去实现。未来 AI 会替用户主动思考,甚至无需用户介入就能完成任务。”
Google Cloud 提供符合我们技术需求的多样先进模型,且这些模型支持大量不同语言,能大幅简化我们的开发工作。
史团委
传音 TEX AI 中心总经理
为了将这个愿景带给数以亿计、语言文化各异的新兴市场用户,传音需要一个具备顶尖模型能力、支持多模态交互、能够构建复杂智能体并覆盖全球的强大 AI 平台。Google Cloud 的 AI 模型符合这些条件,促成传音和 Google Cloud 之间的深入合作。
“我们的目标不只是开发顶尖的 AI 功能,还要让所有人都能轻松使用这些功能。”史团委指出。
运用 Gemini 的不同模型和 A2A(Agents2Agents)、MCP(Model Context Protocol)等新技术,传音开发了语音助手 Ella 和多个 Agent 产品,支持从普通文本对话到实时音视频交互的多样模式,覆盖语音控制、信息查询、生活服务等不同场景。运用 Gemini 1.5 Flash 的代理能力,Ella 能更好地理解用户指令并快速回复,接收第一个词元只需要 0.23 秒。
基于 Ella 模型,传音成功打造了一键问屏、智慧识屏、AI 搜索、通话摘要、AI Writing 等一系列让用户生活更便利的产品功能。例如,受 Gemini 1.5 Flash 高达 100 万个词元的上下文窗口范围支持,传音 Ella 的 AI Writing 功能可以不受文本长度限制地生成、校对和润色文字,让用户能尽情发挥创造力。
此外,传音也将 Gemini 的文字润色能力与 Imagen 和 Veo 结合,打造 AI 图像和视频生成器。只需要几个关键词,AI 图像和视频生成器即能精炼用户输入的描述,让 Ella 快速生成指定风格的高质量图像。
为进一步降低新兴市场用户的视频创作门槛,传音基于 Ella 的轻量化多模态生成工具,运用 Agent Development Kit (ADK) 快速开发并部署了图生视频的子 Agent,并针对社交分享、知识科普、商业推广等本地化场景适配。在此架构中,传音使用 Gemini 等大语言模型进行决策、推理和规划,并运用 Cloud SQL 或 Gemini Enterprise Agent Platform Agent Engine Sessions 存储单个任务期间的上下文和状态、Firestore 或 Gemini Enterprise Agent Platform Vector Search 存储需要长期保留的知识或可供语义搜索的信息,支持子 Agent 的长短期记忆。史团委表示,基于 Google Cloud 弹性算力的资源调度策略,有效降低了视频的生成成本。
Gemini、Imagen、Veo 等 Google Cloud AI 模型的高性能和互操作性,为我们的 AI 产品开发带来了极大助益。此外,Google Cloud 丰富的 AI 开发工具和基础设施资源,也有助于支持我们后续的多模态功能迭代。
史团委
传音 TEX AI 中心总经理
传音作为全球新兴市场手机行业的中坚力量之一,非常重视前沿科技是否能真正服务每个人的生活。例如,针对缺乏功课辅导资源的孩童,传音在手机上开发了图文问答功能,由 Google Cloud 的多模态和知识库能力驱动,针对教育场景进行了深度训练,能够精准解答个学科难题。用户只需用手机拍下题目,Ella 就能给出详尽的解答和思路分析。
为了向移动网络较复杂的区域传递 PB 级别的数据,以及数十亿多变、有低延迟要求的 API 呼叫,同时确保数据安全,传音使用 Google Cloud Global Front End 建构了一个高速、安全的信息传递系统。Google Cloud Global Front End 集成 Cloud CDN 的边缘缓存功能、Cloud Load Balancing 的智能路由功能,以及 Google Cloud Armor 企业级别的安全防护,让传音能直到边缘节点都保持安全连接,在 Google 的优质网络骨干上为重要的 API 流量选择最佳路径,同时又能立即防御机器人攻击和 DDoS 威胁。针对数据量较大的内容,传音也使用 Media CDN 直接从 Cloud Storage 将数据推送到边缘节点,实现快速传递。
通过与 Google Cloud 的深度合作,我们正持续为广大的新兴市场量身打造新一代 Agent 与生态引擎,确保前沿科技惠及每一位用户。
史团委
传音 TEX AI 中心总经理
在数据安全方面,传音计划为其支持 Ella 的多云 MultiAgent 建立一套统一、可信的身份认证和数据回流体系,严格遵守数据主权和法规要求。在需要满足数据主权的关键地理区域,传音会部署独立的区域中心,负责接受、处理和存储该区域内所有 Agent 回流的数据。另外,传音还将建立一个基于 SPIFFE/SPIRE 标准的服务身份认证中心。每个 Agent 在启动时,会使用 Google Cloud Service Account 等其所在云平台原生身份,向 SPIRE 服务器进行身份证明。验证身份后,SPIRE 服务器会颁发可自动轮换、与云平台无关的身份凭证 SVID,用于 Agent 与其他组件所有通信的双向 TLS 加密认证。如此一来,多云环境下的 Agent 身份便能统一管理,并极大地提升安全性。
接下来,传音将向全球开发者发出邀请,共同建设开放的 AI 应用生态与 Agent 生态,让创新源于全球智慧。同时,传音也会持深化与 Google Cloud AI 能力的融合,拓展更多本地化场景,提升 Ella 的生成效果与交互效率。
深圳传音控股股份有限公司(简称“传音”)是一家全球范围领先的智能终端产品和移动互联网服务提供商,以手机为核心产品。传音致力于缩小新兴和成熟市场之间的数字鸿沟,已在非洲、巴基斯坦、孟加拉和菲律宾等地区受到消费者广泛喜爱。
行业: 制造业
地区:中国
使用的产品:Google Cloud, Agent Development Kit, Cloud CDN and Media CDN, Cloud Load Balancing, Cloud SQL, Cloud Storage, Firestore, Gemini, Google Cloud Armor, Google Cloud Global Front End, Imagen, Veo, Gemini Enterprise Agent Platform