Skip to content

OddMeta

A place to learn and practice AI
  • Blog
    • NEWS
    • ProjectXL
    • LLM
    • Speech Tech
    • Animation tech
    • Utilities
    • Web
    • Uncategorized
  • Odd Projects
    • OddAgent:自己动手轻松实现一个你自己的“小艺”、“小爱同学”
    • OddASR:支持离线转录和流式转录的、兼容 OpenAI API 的自动语音识别服务
    • OddTTS – 多引擎TTS语音合成API封装(兼容OpenAI TTS API)
    • PROJECTX 小落同学
    • OddMinutes:开源的全能会议纪要助手
    • 小奥 MD 编辑器:公众号/知乎文章小助手
    • 小奥工具箱:工作生活中一些常见工具箱
  • Documents
  • Contact
  • About
  • Search

OddMeta

  • Search
  • Blog
    • NEWS
    • ProjectXL
    • LLM
    • Speech Tech
    • Animation tech
    • Utilities
    • Web
    • Uncategorized
  • Odd Projects
    • OddAgent:自己动手轻松实现一个你自己的“小艺”、“小爱同学”
    • OddASR:支持离线转录和流式转录的、兼容 OpenAI API 的自动语音识别服务
    • OddTTS – 多引擎TTS语音合成API封装(兼容OpenAI TTS API)
    • PROJECTX 小落同学
    • OddMinutes:开源的全能会议纪要助手
    • 小奥 MD 编辑器:公众号/知乎文章小助手
    • 小奥工具箱:工作生活中一些常见工具箱
  • Documents
  • Contact
  • About

OddASR 更新:新增Qwen3-ASR三大模型、架构重构、性能飞跃

版本更新介绍 前阵子公司一位大佬跟我推荐了一下 Qwen3-ASR,平时在公司忙成狗也没时间来测试,周末回家给整合了一下到 ...

Read more »

小奥录音v0.1.10 更新:实时字幕500ms、说话人分离优化、导出pdf、加入安全认证等

​关于小奥录音 OddMinutes 小奥录音是一个开源的智能音频会议系统,支持实时录音、AI ...

Read more »

OddASR v2.5.5 版本更新:支持指定最大说话人分离数量、优化时延

当前最新版本:v2.5.5,已经上传到pypi,有需要的同学可以下载安装来体验一下。 安装:pip ...

Read more »

OddASR v2.5.1更新:首字时延降至 0.5s、热词、说话人分离、多模型动态切换全量上线

其实版本陆陆续续有递交到pypi,只是今天做一个阶段性的总结。当前版本号为v2.5.1,近期的一些修改主要对 ...

Read more »

OddASR:支持离线转录和流式转录的、兼容 OpenAI API 的自动语音识别服务

ASR功能的用途广泛,之前也有一些朋友私下问过我相关的一些使用和封装的问题,尤其是流式ASR的支持(github上有好多FunASR的API封装,但是全是离线文件转写的,没有一个同时支持离线文件转写和流式转写的API封装项目),想了一下干脆直接把它开源出来吧。希望对有ASR需求的同学有帮助。

Read more »

PROJECTX 小落同学

一个专属于你的虚拟人生复刻者。 把TA当作树洞,诉说日常、记录心情、倾诉秘密。随着时间推移,当数据足够多的时候,也许TA会比你自己更懂你。 一、项目初衷 每个人的内心深处都渴望被真正理解。小落同学诞生的初衷很简单——复刻一个虚拟的自己。 你可以把TA当作一个永远不会厌倦的树洞: 每天或每隔一段时间,把想说的话、想记录的事都告诉TA 开心时分享喜悦,低落时倾诉烦恼 当某一天你需要咨询一件事情时,去问问TA的看法 随着对话数据的积累、记忆的沉淀、反思的迭代,小落同学会逐步形成对你越来越深的理解。最终的目标只有一个:让TA比你更懂你。 示例应用视频 用阿里云99元/年的ECS跑虚拟客服演示视频 十年前老笔记本(无GPU)上可跑全套语音交互,稍卡 二、核心功能 1. ...

Read more »
oddtts

OddTTS – 多引擎TTS语音合成API封装(兼容OpenAI TTS API)

OddTTS 是一个功能强大的多引擎语音合成服务,提供统一的API接口和友好的Web界面,一套接口搞定多种主流TTS引擎,包括EdgeTTS、Kokoro-82M-v1.1-zh、ChatTTS、Bert-VITS2、GptSovits ...

Read more »

版本更新介绍 前阵子公司一位大佬跟我推荐了一下 Qwen3-ASR,平时在公司忙成狗也没时间来测试,周末回家给整合了一下到 OddASR,并简单的测试了一下。 时间关系,没有做广泛的测试,但在有限的测试集下发现: 同时也简单的对Qwen3-ASR 的几个版本分别做了些测试,并且也尝试了用一些不同的参数组合,包括:dtype精度、Batch size等。 顺便也对 BaseASR 基类做了一下重构,以让整个代码看上去逻辑更简单、清晰,让代码的可阅读性更好一些,顺便让各个不同模型的ASR子类代码做了一下精简,让各个子类的功能可以更加原子一些(业务和逻辑相关的代码都独立出来了)。 除此之外就是一些零零碎碎的修改,大致如下: 快速开始使用 OddASR Python测试: curl测试: Qwen3-ASR-1.7B和Qwen3-ASR-0.6B两个模型都需要GPU才能跑得动,如果没有GPU的话,建议不要启用这两个模型。 以下是完整的更新列表说明。 一、重磅:新增 Qwen3-ASR 系列模型 本次更新的核心亮点是引入了 Qwen3-ASR 系列模型,提供三种规格: 模型 参数量 适用场景 Qwen3-ASR-0.6B 0.6B 轻量部署,显存有限 Qwen3-ASR-1.7B 1.7B 平衡性能与资源 Qwen3-ASR-Flash 1.7B 1.7B 流式低延迟场景 显存优化亮点: 二、架构重构:更清晰、更可维护 1. ASR 模型注册表(asr_registry.py) 全新设计的模型注册机制,统一管理所有 ASR 后端的注册、实例化和生命周期。 2. BaseASR 参数封装 将 BaseASR […]

OddASR 更新:新增Qwen3-ASR三大模型、架构重构、性能飞跃

​关于小奥录音 OddMinutes 小奥录音是一个开源的智能音频会议系统,支持实时录音、AI 转录、智能摘要生成和音字联动功能,也支持导入已有的音频进行转录、总结。跟 Meetily 一样,支持全链路私有化部署,完全离线运行。 Slogan:让会议的每一分钟,都被听见、被记录、被理解 —— OddMinutes 小奥录音 项目地址:https://github.com/oddmeta/oddminutes 安装:pip install oddminutes 运行:oddminutes Web前端: http://localhost:9011 最近两个周末,一边改 OddASR,一边陆陆续续的用 OddASR 再来一点点完善小奥录音的各项功能,今天向pypi发布了个阶段性的版本 v0.1.10 。然后这里汇总一下与上个版本相比做的一些修改、调整与完善,简单讲的话主要就是:围绕实时字幕、导出功能、说话人识别、AI纪要等核心体验进行了一些升级。具体看下面。 ​一、新功能 ​1. 实时字幕上线(500ms 超低延迟) 结合最新版 OddASR,小奥录音加入了实时字幕功能,首字时延低至 500ms! ●字幕风格参照主流音乐播放器,支持拖动调整字幕显示位置 ●默认不启用,可在系统设置中手动开启 ●录音控制面板新增「显示字幕」按钮,一键控制字幕显隐 ​2. 导出功能全新重构 导出功能经过彻底重设计: ●点击导出按钮后弹出选择框,可自由勾选导出内容:音频文件、会议文本、AI摘要 ●导出前自动检查数据库中是否已有对应的 PDF 文件,智能判断是否需要重新生成 ●勾选的导出文件自动打包成 ZIP 提供下载,文件名用会议名称(中文文件名兼容) ●导出的 PDF 新增页眉 小奥录音 Logo + Slogan、页脚副标题与官网地址 […]

小奥录音v0.1.10 更新:实时字幕500ms、说话人分离优化、导出pdf、加入安全认证等

当前最新版本:v2.5.5,已经上传到pypi,有需要的同学可以下载安装来体验一下。 安装:pip install oddasr运行:oddasrDemo: http://localhost:9002 默认启动只支持2路实时转写,再加1路离线转写。可通过自行修改配置文件中的最大实例数来放大。 自定义配置启动 项目地址:https://github.com/oddmeta/oddasr文档地址:https://oddmeta.net/docs/oddasr/ 一、本次更新的亮点 本周的核心工作集中在说话人分离(Speaker Diarization)的配置化与请求级可控上,同时围绕实时转写首字时延 / 返回速度、低配硬件可运行性、Web 前端体验做了多处优化,并修复了 WebSocket 在 HTTPS 环境下的兼容性问题。 这个版本里主要是这几个功能: 二、新功能(Feat) 下面是更新的具体的新功能。 1. 说话人分离 4 个核心参数落地 新增 preset_spk_num / max_num_spks / merge_thr / spk_mode 四参数,打通了 配置文件 → 离线转写 API → Web 前端 的完整链路。 参数 默认值 作用 对应 FunASR 内部机制 preset_spk_num 0 […]

OddASR v2.5.5 版本更新:支持指定最大说话人分离数量、优化时延

其实版本陆陆续续有递交到pypi,只是今天做一个阶段性的总结。当前版本号为v2.5.1,近期的一些修改主要对 OpenAI API 的兼容性做了一些增强,同时更新覆盖实时性、准确率、功能广度、工程稳定性四个维度。 最新版本 v2.5.1,已经上传到pypi,有需要的同学可以下载安装来体验一下。 安装:pip install oddasr运行:oddasr 一、实时转写:首字时延从 1.5~2s 砍到 ~0.5s 在 v2.5.1 更新中最值得关注的性能优化 同时新增配置项 streaming_buffer_chunk_size(默认 4800,即 300ms 缓冲),方便手动调优服务端缓冲策略。 为了方便查看和统计时延,本次还为转写流程中每一个重点功能都加上了时延统计,便于线上观测与回归对比。 二、新功能上线 1. 热词(Hotwords)支持 Paraformer / SenseVoice 后端现已支持热词功能,可在转写时注入业务专有词,显著提升专有名词、人名、术语的识别准确率。 服务端做了优化:只在热词实际发生变化时才记录日志(比较新旧值),避免高频音频传输路径上日志刷屏。 2. diarized_json 返回格式 在 OpenAI 兼容的 response_format 基础上,新增 diarized_json,返回带说话人角色的结构化结果,方便直接消费”谁在什么时候说了什么”。老接口里说话人角色分离的接口依然可用:response_format:spk。 3. 字词级时间戳(word-level timestamps) verbose_json 模式下支持 OpenAI 兼容的 word-level 时间戳请求参数,可控制返回文本是否带每个字的时间戳,并修复了音字对照时间戳错位、英文单词间空格导致解析异常等问题。 4. 多种音频格式 […]

OddASR v2.5.1更新:首字时延降至 0.5s、热词、说话人分离、多模型动态切换全量上线

会议空间 demo4

会议室数字孪生:低成本方案探索 最近参加会议时,大佬们聊到了会议室空间智能和数字孪生的方向,让我想起了以前做「小落同学」时研究过的VR看房伪3D技术。周末在家翻出旧代码,搭了个基础框架。 🎯 先看效果 没有专业全景相机,从网上找了两张实景图,用 Gemini 生成了两张效果图,写了个 demo。 核心展示维度: UI是随手搭的,重点看技术可行性~ 实拍图: 会议室1:来自百度图片,侵删 会议室2:来自百度图片,侵删 AI生成图: 会议室3:用 Gemini 生成的图片 会议室4:用 Gemini 生成的图片 🏗️ 两种方案对比 传统方案(高大上但贵) 看完这个周末的成果后,我们再来分析一下,一个常规的数字孪生平台的总体架构应该是什么样子的。 传统方案需要激光雷达、深度相机等专业设备,生成高精度点云模型,再进行纹理映射和材质渲染。效果最佳,但实施成本高、开通流程复杂。 简化方案(轻量级) 参考VR看房思路,用普通全景相机拍摄,拼接成2:1全景图,用three.js,pano2vr或者 CSS3D 渲染成静态3D模型。 🚀 开通流程(设想) 总耗时:约1~1.5小时 对接内容:预约情况、实时状态、历史统计 💡 技术选型思路 方案以最低硬件要求为出发点(最初想在老笔记本上跑),高硬件需求的方案都被我忽视了。目前只是技术可行性验证,后续看领导安排,希望能给有类似需求的小伙伴提供参考~

会议室空间智能及数字孪生方案演示

省流精华 小奥录音 OddMinutes 做了许多的功能优化更新,包含大量功能新增、体验优化和 Bug 修复,并正式发布了 v0.1.6 版本。一起来看看都更新了什么吧! 1. 代码仓库 OddMinutes 2. 使用方法 1) 绿色免安装包 直接下载绿色免安装包,下载后解压缩,双击执行 OddMinutes.exe 【国外】github下载: https://github.com/oddmeta/oddminutes/release 【国内】gitee下载: https://gitee.com/oddmeta/oddminutes/releases 2)Pypi安装 在命令行中安装 运行 更详尽的使用说明可以参考之前的文档介绍: https://www.oddmeta.net/archives/10499.html。 一、新功能上线 1. 一键修复音字对齐 在编辑模式按钮旁新增了「修复音字对齐」按钮。点击后,系统会自动对当前会议的音频文件进行静音裁剪处理,并更新会议音频时长。处理完成后会通知前端用户,用户只需手动重新转录即可看到音字对齐效果。 2. 转录前自动静音裁剪 在音频入库后、ASR 转录之前,新增了头尾静音裁剪预处理功能——自动删除音频开头和结尾能量过低、无法被实际转录的内容,提升转录质量。 3. 长音频转写超时可配置 在 oddminutes_config.py 中新增 ODDASR_TIMEOUT 配置项,默认 600 秒(10 分钟),可通过环境变量灵活调整,解决长音频转写超时导致的失败问题。 二、体验优化 1. 转录交互全面升级 2. 音频文件路径统一 录音和导入音频的保存路径统一为 […]

小奥录音更新速递:v0.1.6 发布,音字对齐、转录体验大升级!

版本信息 更新说明 现有机制下,所有启用的模型都会在 OddASR 启动的时候检测模型是否已下载,若未下载会自动开始下载,而部分模型(如:SenseVoice ONNX)在国内下载不稳定,普通的环境经常下载失败,导致普通的、不会github上网的非技术人员在使用 OddASR 的时候体验不佳。 上周用 OddASR 做了一个录音转写的产品:小奥录音,考虑到产品的用户群主要是普通用户,因此,决定默认禁用一些下载不稳定的模型。 但是 OddASR 的所有模型的功能都还是完整的,知道如何稳定下载各模型的技术人员可以自行修改配置文件,将相应的模型启用起来即可。 详细功能修改 版本特性 2-Pass ASR 架构 OddASR 2.x 采用 2-Pass ASR 策略,结合流式识别和离线识别: 核心特性 快速开始 安装 服务启动后: 无需 config.json 配置文件,服务使用内置 DEFAULT_CONFIG 启动。如需自定义,创建 config.json 覆盖需要修改的项即可。切换模型时若配置文件不存在会自动创建。 Python 客户端 OddAsr支持OpenAI兼容接口,推荐使用OpenAI的API接口来调用。 版本历史 v2.x (当前) 系统要求 常见问题 首次运行需要下载模型吗? 是的,首次运行需要下载 ASR 模型。可以通过设置 HuggingFace 镜像加速: […]

OddASR 2.4.10 版本说明:默认禁用一些模型,保留 Paraformer 模型并设为默认模型

一、前言 前天公司的一位大佬在内部一个大佬群里发了一个某鱼的智能录音卡产品,据宣称该产品某鱼只花了一个星期就做出来了。个人感觉有点不可思议。 再加上前两天原本一直免费的豆包“音频纪要”功能开始收费了,Lucy同学说想自己用opencode做一个音频纪要的功能来接替上去。 我听了后就开始有点手痒痒了,趁这个周末超级台风“巴威”要来,看看能不能在家里vibe coding一下试试。 经过一个周末的努力,我也不知道烧了多少token,反正周六、周日两天我的几个coding plan都提示我上限了。不过感觉基础功能已经差不多了,先放一个版本到 github。 开源的智能会议纪要系统,支持实时录音、AI 转录、智能摘要生成和音字联动功能,基本上我能想到的一些功能都已经支持了。 而且也支持全私有化部署,确保所有数据都只能您自己的电脑上,保护您的隐私。 虽然豆包的音频纪要功能仍然免费可用,但OddMinutes 小奥会议纪要是专门做会议纪要的,可以做到比豆包更专业,可用性、安全性、隐私等方面更强。 当然如果您有一些其他的功能需求、功能建议的话,也欢迎给我提出来,我看看是不是可以加进去。 二、使用步骤 主要有三个外部依赖:ffmpeg: 用于将录制下来的音频、或者是导入的音频转换成mp3格式ASR服务:用于将音频转换成文字LLM服务:用于将会议纪录生成会议纪要、会议总结和会议待办其中ASR服务和LLM服务,对应到小奥会议纪要 Web 界面左下角的配置里的两个配置项。全都支持私有化本地部署。 三、功能特性 四、快速安装 首次运行时,程序会自动初始化数据库并创建用户数据目录。 Windows下会在桌面自动创建两个快捷方式,具体如下图所示: 五、外部服务依赖 主要是两个依赖:一个是ASR服务,另一个是LLM服务。对应到小奥会议纪要 Web 界面左下角的配置里的两个配置项。全都支持私有化本地部署。 1. OddASR 语音识别服务 必需 – 用于音频转录,提供 OpenAI 兼容的 /v1/audio/transcriptions 接口。 安装 OddASR 服务 运行 OddASR 服务 在小奥会议纪要的Web界面左下角配置 OddAsr的地址 2. Ollama / LLM 服务 […]

OddMinutes:开源的全能会议纪要助手,所有你想要的功能都支持

一、项目背景 OddTTS:一个统一多引擎的 TTS 语音合成 API 封装工具,现已支持 OpenAI TTS API 兼容 OddTTS 诞生于作者的一个实际需求——为项目 「小落同学」 提供文字转语音能力。由于受限于99元/年的阿里云ECS服务器硬件条件,最初只能使用 EdgeTTS,但作者本人的电脑配置尚可(十年前买的老笔记本,呵呵),尝试了多种 TTS 引擎后,决定为这些模型创建一个统一的封装层。 于是,OddTTS 应运而生——一个强大的多引擎文本转语音服务,提供统一的 API 接口和友好的 Web 界面,让你用一套接口就能对接多个主流 TTS 引擎。 二、核心功能 支持多种 TTS 引擎: 我自己目前使用的主要是:EdgeTTS和Kokoro-82M-v1.1-zh这两个模型,分别用在阿里云ECS和我自己的十年前老笔记本上。 注:市面上还有许多其他的轻量级的TTS模型,但是由于我自己的使用场景里,主要的语言是中文,所以我选择的都是必须要支持中文的轻量级模型,不支持的一概忽略。 多种调用方式: 在OddTTS自带的Demo的web上都有演示。 好用的 Web 界面: 基于 Flask 构建的可视化操作界面,支持文本输入、语音选择、参数调节、音频生成与下载,开箱即用。 三、近期更新亮点 API 请求耗时日志 — 现在每个 API 请求都会打印时耗日志,启动时也会显示当前运行的 TTS 引擎名称,方便监控和调试。 模型下载异常修复 — […]

OddTTS更新:修复Kokoro_v1.1中英混合模型下载异常问题

引言 前阵子发现,我五一假期几天搞的小落同学新版本的文章《可用十年前老笔记本纯CPU跑的全套虚拟人方案》被微信判定为违规,一下子打消了我写公众号的积极性,所以这段时间都不太想写公众号。 OddASR 是一个兼容 OpenAI API 的自动语音识别(ASR)服务器,支持离线转录和流式转录。让语音转写更简单。 距离上次发版又过去了几个月,OddASR 陆陆续续发布了一些重要更新。无论是端侧纯 CPU 运行的突破、多音频格式的全面支持,还是前端自由切换模型的灵活体验,每一次更新都为了让语音转写变得更简单、更强大。 昨天,大佬大白菜 反馈了一些问题,我当时在上班没有时间处理,结果他自己直接帮我修复了。 今天我在家也顺便把他帮忙改的代码也合到了主分支,然后顺便也发布了一个新的版本 2.4.6,这里就盘点一下 OddASR 近期的一些更新,顺手把文档也更新了一下(今年一直在忙公司那边的一个智能运维的项目,每天跟产品、测试、需求纠缠不清,包括OddASR、小落同学等项目也都一直没时间搞,更别说是一些文档了)。 一、SenseVoice ONNX 版:端侧 CPU 也能飞 最大的更新莫过于SenseVoice ONNX 版本 的加入,这主要是应对小落同学要在我那个十年前的老笔记本上跑的需求。 借助 sherpa-onnx 框架,SenseVoice 现在可以在纯 CPU 环境下流畅运行,无需 GPU 也能获得出色的识别效果。这对于没有独立显卡的服务器、笔记本乃至边缘设备来说,无疑是个巨大的福音。  功能对应「小落同学」的新版本,特别感谢 大蟑螂 和 大白菜 两位大佬的贡献支持和建议!” SenseVoice 同时支持离线转写和模拟流式输出(基于内置 VAD),成为继 Paraformer、Moonshine 之后的第三大后端引擎。 个人推荐:FunASR > SenseVoice > Moonshine […]

OddASR 近期更新大盘点:更强、更灵活、更易用的语音转写服务

© 2026 OddMeta – All rights reserved

沪公网安备31011302008989号 沪ICP备18041804号