Aimyflow

GitHub - wpydcr/NanoAvatar: 实时、高质量说话数字人,即使在老旧安卓手机上也能运行:41 FPS,首帧仅需 103 毫秒。 · GitHub

NanoAvatar 是一款开源工具,可帮助开发者无需云端 GPU、直接在移动设备上生成实时且唇形同步的说话数字人。这种端侧运行能力使软件工程师能够部署高响应度的交互式角色,同时消除了云端渲染依赖和延迟。

GitHub - wpydcr/NanoAvatar: 实时、高质量说话数字人,即使在老旧安卓手机上也能运行:41 FPS,首帧仅需 103 毫秒。 · GitHub

为这个工具评分

平均分

0.0

总投票数

0票

选择你的评分(1-10):

详细信息

项目简介

NanoAvatar 是一款开源的实时数字人(Talking-Avatar)生成引擎,旨在直接于移动设备和桌面 GPU 上本地运行,无需依赖云端渲染服务器。该项目面向边缘 AI 工程师与交互式应用开发者,旨在解决服务端数字人视频生成所面临的高昂基础设施成本和网络延迟问题。其定位是一个轻量级、低延迟的唇形同步框架,能够在消费级边缘硬件上实现实时渲染。

核心特性

  • 端侧移动推理: 提供专用的 Full 与 Lite 资源包,可在 Android 芯片组上实现本地化视频生成,彻底免除持续的云端 GPU 渲染成本。
  • 低延迟流式驱动: 在接入流式文本转语音(TTS)管线时,仅需约 0.3 秒即可开始渲染唇形同步视频,大幅降低实时交互中的响应延迟。
  • 桌面端量化运行时: 可在 NVIDIA GPU 上的 PyTorch 环境中直接执行 INT8 与 W8A16 混合精度的 TorchScript 模型,规避了编译自定义 CUDA 动态链接库的运维复杂度。
  • 对话式 AI 模式: 原生对接阿里云百炼(DashScope)API(支持通义千问语言模型与 CosyVoice 语音合成),可直接驱动基于语音的实时数字人对话。

使用建议

  • 注意模型许可协议: 尽管基础代码采用 MIT 许可证,但核心唇形同步模型权重遵循 CC BY-NC 4.0 协议,禁止商业用途;商用需联系作者获取明确授权。
  • 根据目标硬件选配模型版本: 若部署在骁龙 8 Gen 1 等较旧的硬件平台上,建议选用 Lite 模型包,以确保合理的内存占用和流畅的帧率。
  • 确认 Web 运行环境依赖: 本地部署 Web 服务时,请确保主机环境运行 Python 3.11 以及相兼容的 PyTorch CUDA 版本,以防运行时出现环境不匹配错误。

OpenClaw 技能集成

NanoAvatar 仓库目前未包含任何针对 OpenClaw 生态的原生集成文档。作为一种假设的应用场景,可通过配置 OpenClaw Agent 将生成的语音音频直接路由至本地 NanoAvatar 运行时,从而使自主 Agent 工作流能够在边缘设备上输出动态视频流。该架构可应用于自动化客服或各类自助终端,完全基于本地硬件提供可视化交互式数字人服务,且无需承担额外的外部视频推流基础设施费用。

嵌入代码

将下面的代码复制到你的网站或博客中,即可展示这个 AI 工具。嵌入的小组件会自动同步最新信息。

响应式设计
自动更新
安全 iframe
<iframe src="https://aimyflow.com/ai/github-com-wpydcr-nanoavatar/embed" width="100%" height="400" frameborder="0"></iframe>

探索相似工具

查看全部
LinkedIn Queens 今日答案 - 每日解答与存档

LinkedIn Queens 今日答案 - 每日解答与存档

非官方 LinkedIn Queens 答案指南,提供每日解答、提示、规则和历史谜题页面,适合玩家核对答案或练习 Queens。

批量图片放大工具 – 用 AI 批量放大图片

批量图片放大工具 – 用 AI 批量放大图片

Bulk Image Upscaler 是一款 AI 批量处理工具,专为创作者、电商卖家和摄影师打造,可放大并修复 JPG、PNG 和 WebP 文件。通过利用各类专业模型实现多图像自动放大,它大幅简化了面向高分辨率印刷与线上商品展示的素材准备流程。

Vidnoz AI:在线免费创建 AI 视频,速度提升 10 倍

Vidnoz AI:在线免费创建 AI 视频,速度提升 10 倍

Vidnoz 是 AI 视频生成平台,支持使用数字人、AI 配音和自动化工具创建视频,适合营销、培训和内容创作团队。

音频转文字转换器 - 在线语音转文字 | transcribetotext.org

音频转文字转换器 - 在线语音转文字 | transcribetotext.org

Transcribe to Text 是一款 AI 语音转文本转换器,可将音频和视频文件转换为可编辑的转录文本,支持 120 多种语言、多种格式、时间戳和导出功能,主要面向内容创作者、专业人士和团队。对于媒体、运营和文档工作流,它可以加快转录、字幕准备和多语言内容处理,同时减少手动记录。

免费 AI 色情生成器 | 即时生成 4K 色情照片和视频 2026

免费 AI 色情生成器 | 即时生成 4K 色情照片和视频 2026

UndressAITool 是一款 AI 成人内容生成器,可根据文本提示生成露骨图像、视频、GIF 和 4K 放大输出,主要面向成人内容创作者以及寻求无需注册即可在浏览器中生成内容的用户。对于使用合成媒体的创作者来说,它可以通过快速生成草稿视觉内容和多种变体来加快从概念到成品的工作流程,同时提供私密存储和删除控制。

AI漫画翻译器|在线翻译漫画图片 - 漫画翻译器

AI漫画翻译器|在线翻译漫画图片 - 漫画翻译器

Manga Translator 是一款 AI 工具,能够识别并翻译漫画对白,生成面向读者与本地化专家的可编辑图像。通过自动化文本提取和图内排版,它加速了漫画本地化工作流程,使编辑能够专注于风格设计与质量把控。

在线 AI 音乐生成器(免费、无需注册、免版税)

在线 AI 音乐生成器(免费、无需注册、免版税)

AIMusicGen.ai 是一款 AI 音乐生成器,可帮助用户在线将文本、歌词或歌曲描述转换为免版税的人声或器乐曲目,主要面向内容创作者、营销人员和音乐专业人士。在 AI 辅助的制作工作流程中,它可以加快视频、广告和音乐团队的配乐草案拟定、样带制作以及营销活动音频开发。

VoooAI - 首个多媒体 NL2Workflow 平台 | 一句话,完成完整创意工作流

VoooAI - 首个多媒体 NL2Workflow 平台 | 一句话,完成完整创意工作流

VoooAI 是全球首个带可视化节点画布的多媒体 NL2Workflow 平台。AI 可自动生成工作流:自动选择节点、连线,并填充提示词。每个节点均可调整。提供从文案创作到视频、音乐、数字人的完整流程。70+ 模板。不是聊天界面。