会议室数字孪生:低成本方案探索 最近参加会议时,大佬们聊到了会议室空间智能和数字孪生的方向,让我想起了以前做「小落同学」时研究过的VR看房伪3D技术。周末在家翻出旧代码,搭了个基础框架。 🎯 先看效果 没有专业全景相机,从网上找了两张实景图,用 Gemini 生成了两张效果图,写了个 demo。 核心展示维度: UI是随手搭的,重点看技术可行性~ 实拍图: 会议室1:来自百度图片,侵删 会议室2:来自百度图片,侵删 AI生成图: 会议室3:用 Gemini 生成的图片 会议室4:用 Gemini 生成的图片 🏗️ 两种方案对比 传统方案(高大上但贵) 看完这个周末的成果后,我们再来分析一下,一个常规的数字孪生平台的总体架构应该是什么样子的。 传统方案需要激光雷达、深度相机等专业设备,生成高精度点云模型,再进行纹理映射和材质渲染。效果最佳,但实施成本高、开通流程复杂。 简化方案(轻量级) 参考VR看房思路,用普通全景相机拍摄,拼接成2:1全景图,用three.js,pano2vr或者 CSS3D 渲染成静态3D模型。 🚀 开通流程(设想) 总耗时:约1~1.5小时 对接内容:预约情况、实时状态、历史统计 💡 技术选型思路 方案以最低硬件要求为出发点(最初想在老笔记本上跑),高硬件需求的方案都被我忽视了。目前只是技术可行性验证,后续看领导安排,希望能给有类似需求的小伙伴提供参考~
Monthly Archives: July 2026
省流精华 小奥录音 OddMinutes 做了许多的功能优化更新,包含大量功能新增、体验优化和 Bug 修复,并正式发布了 v0.1.6 版本。一起来看看都更新了什么吧! 1. 代码仓库 OddMinutes 2. 使用方法 1) 绿色免安装包 直接下载绿色免安装包,下载后解压缩,双击执行 OddMinutes.exe 【国外】github下载: https://github.com/oddmeta/oddminutes/release 【国内】gitee下载: https://gitee.com/oddmeta/oddminutes/releases 2)Pypi安装 在命令行中安装 运行 更详尽的使用说明可以参考之前的文档介绍: https://www.oddmeta.net/archives/10499.html。 一、新功能上线 1. 一键修复音字对齐 在编辑模式按钮旁新增了「修复音字对齐」按钮。点击后,系统会自动对当前会议的音频文件进行静音裁剪处理,并更新会议音频时长。处理完成后会通知前端用户,用户只需手动重新转录即可看到音字对齐效果。 2. 转录前自动静音裁剪 在音频入库后、ASR 转录之前,新增了头尾静音裁剪预处理功能——自动删除音频开头和结尾能量过低、无法被实际转录的内容,提升转录质量。 3. 长音频转写超时可配置 在 oddminutes_config.py 中新增 ODDASR_TIMEOUT 配置项,默认 600 秒(10 分钟),可通过环境变量灵活调整,解决长音频转写超时导致的失败问题。 二、体验优化 1. 转录交互全面升级 2. 音频文件路径统一 录音和导入音频的保存路径统一为 […]
版本信息 更新说明 现有机制下,所有启用的模型都会在 OddASR 启动的时候检测模型是否已下载,若未下载会自动开始下载,而部分模型(如:SenseVoice ONNX)在国内下载不稳定,普通的环境经常下载失败,导致普通的、不会github上网的非技术人员在使用 OddASR 的时候体验不佳。 上周用 OddASR 做了一个录音转写的产品:小奥录音,考虑到产品的用户群主要是普通用户,因此,决定默认禁用一些下载不稳定的模型。 但是 OddASR 的所有模型的功能都还是完整的,知道如何稳定下载各模型的技术人员可以自行修改配置文件,将相应的模型启用起来即可。 详细功能修改 版本特性 2-Pass ASR 架构 OddASR 2.x 采用 2-Pass ASR 策略,结合流式识别和离线识别: 核心特性 快速开始 安装 服务启动后: 无需 config.json 配置文件,服务使用内置 DEFAULT_CONFIG 启动。如需自定义,创建 config.json 覆盖需要修改的项即可。切换模型时若配置文件不存在会自动创建。 Python 客户端 OddAsr支持OpenAI兼容接口,推荐使用OpenAI的API接口来调用。 版本历史 v2.x (当前) 系统要求 常见问题 首次运行需要下载模型吗? 是的,首次运行需要下载 ASR 模型。可以通过设置 HuggingFace 镜像加速: […]
一、前言 前天公司的一位大佬在内部一个大佬群里发了一个某鱼的智能录音卡产品,据宣称该产品某鱼只花了一个星期就做出来了。个人感觉有点不可思议。 再加上前两天原本一直免费的豆包“音频纪要”功能开始收费了,Lucy同学说想自己用opencode做一个音频纪要的功能来接替上去。 我听了后就开始有点手痒痒了,趁这个周末超级台风“巴威”要来,看看能不能在家里vibe coding一下试试。 经过一个周末的努力,我也不知道烧了多少token,反正周六、周日两天我的几个coding plan都提示我上限了。不过感觉基础功能已经差不多了,先放一个版本到 github。 开源的智能会议纪要系统,支持实时录音、AI 转录、智能摘要生成和音字联动功能,基本上我能想到的一些功能都已经支持了。 而且也支持全私有化部署,确保所有数据都只能您自己的电脑上,保护您的隐私。 虽然豆包的音频纪要功能仍然免费可用,但OddMinutes 小奥会议纪要是专门做会议纪要的,可以做到比豆包更专业,可用性、安全性、隐私等方面更强。 当然如果您有一些其他的功能需求、功能建议的话,也欢迎给我提出来,我看看是不是可以加进去。 二、使用步骤 主要有三个外部依赖:ffmpeg: 用于将录制下来的音频、或者是导入的音频转换成mp3格式ASR服务:用于将音频转换成文字LLM服务:用于将会议纪录生成会议纪要、会议总结和会议待办其中ASR服务和LLM服务,对应到小奥会议纪要 Web 界面左下角的配置里的两个配置项。全都支持私有化本地部署。 三、功能特性 四、快速安装 首次运行时,程序会自动初始化数据库并创建用户数据目录。 Windows下会在桌面自动创建两个快捷方式,具体如下图所示: 五、外部服务依赖 主要是两个依赖:一个是ASR服务,另一个是LLM服务。对应到小奥会议纪要 Web 界面左下角的配置里的两个配置项。全都支持私有化本地部署。 1. OddASR 语音识别服务 必需 – 用于音频转录,提供 OpenAI 兼容的 /v1/audio/transcriptions 接口。 安装 OddASR 服务 运行 OddASR 服务 在小奥会议纪要的Web界面左下角配置 OddAsr的地址 2. Ollama / LLM 服务 […]
一、项目背景 OddTTS:一个统一多引擎的 TTS 语音合成 API 封装工具,现已支持 OpenAI TTS API 兼容 OddTTS 诞生于作者的一个实际需求——为项目 「小落同学」 提供文字转语音能力。由于受限于99元/年的阿里云ECS服务器硬件条件,最初只能使用 EdgeTTS,但作者本人的电脑配置尚可(十年前买的老笔记本,呵呵),尝试了多种 TTS 引擎后,决定为这些模型创建一个统一的封装层。 于是,OddTTS 应运而生——一个强大的多引擎文本转语音服务,提供统一的 API 接口和友好的 Web 界面,让你用一套接口就能对接多个主流 TTS 引擎。 二、核心功能 支持多种 TTS 引擎: 我自己目前使用的主要是:EdgeTTS和Kokoro-82M-v1.1-zh这两个模型,分别用在阿里云ECS和我自己的十年前老笔记本上。 注:市面上还有许多其他的轻量级的TTS模型,但是由于我自己的使用场景里,主要的语言是中文,所以我选择的都是必须要支持中文的轻量级模型,不支持的一概忽略。 多种调用方式: 在OddTTS自带的Demo的web上都有演示。 好用的 Web 界面: 基于 Flask 构建的可视化操作界面,支持文本输入、语音选择、参数调节、音频生成与下载,开箱即用。 三、近期更新亮点 API 请求耗时日志 — 现在每个 API 请求都会打印时耗日志,启动时也会显示当前运行的 TTS 引擎名称,方便监控和调试。 模型下载异常修复 — […]
引言 前阵子发现,我五一假期几天搞的小落同学新版本的文章《可用十年前老笔记本纯CPU跑的全套虚拟人方案》被微信判定为违规,一下子打消了我写公众号的积极性,所以这段时间都不太想写公众号。 OddASR 是一个兼容 OpenAI API 的自动语音识别(ASR)服务器,支持离线转录和流式转录。让语音转写更简单。 距离上次发版又过去了几个月,OddASR 陆陆续续发布了一些重要更新。无论是端侧纯 CPU 运行的突破、多音频格式的全面支持,还是前端自由切换模型的灵活体验,每一次更新都为了让语音转写变得更简单、更强大。 昨天,大佬大白菜 反馈了一些问题,我当时在上班没有时间处理,结果他自己直接帮我修复了。 今天我在家也顺便把他帮忙改的代码也合到了主分支,然后顺便也发布了一个新的版本 2.4.6,这里就盘点一下 OddASR 近期的一些更新,顺手把文档也更新了一下(今年一直在忙公司那边的一个智能运维的项目,每天跟产品、测试、需求纠缠不清,包括OddASR、小落同学等项目也都一直没时间搞,更别说是一些文档了)。 一、SenseVoice ONNX 版:端侧 CPU 也能飞 最大的更新莫过于SenseVoice ONNX 版本 的加入,这主要是应对小落同学要在我那个十年前的老笔记本上跑的需求。 借助 sherpa-onnx 框架,SenseVoice 现在可以在纯 CPU 环境下流畅运行,无需 GPU 也能获得出色的识别效果。这对于没有独立显卡的服务器、笔记本乃至边缘设备来说,无疑是个巨大的福音。 功能对应「小落同学」的新版本,特别感谢 大蟑螂 和 大白菜 两位大佬的贡献支持和建议!” SenseVoice 同时支持离线转写和模拟流式输出(基于内置 VAD),成为继 Paraformer、Moonshine 之后的第三大后端引擎。 个人推荐:FunASR > SenseVoice > Moonshine […]