版本更新介绍 前阵子公司一位大佬跟我推荐了一下 Qwen3-ASR,平时在公司忙成狗也没时间来测试,周末回家给整合了一下到 OddASR,并简单的测试了一下。 时间关系,没有做广泛的测试,但在有限的测试集下发现: 同时也简单的对Qwen3-ASR 的几个版本分别做了些测试,并且也尝试了用一些不同的参数组合,包括:dtype精度、Batch size等。 顺便也对 BaseASR 基类做了一下重构,以让整个代码看上去逻辑更简单、清晰,让代码的可阅读性更好一些,顺便让各个不同模型的ASR子类代码做了一下精简,让各个子类的功能可以更加原子一些(业务和逻辑相关的代码都独立出来了)。 除此之外就是一些零零碎碎的修改,大致如下: 快速开始使用 OddASR Python测试: curl测试: Qwen3-ASR-1.7B和Qwen3-ASR-0.6B两个模型都需要GPU才能跑得动,如果没有GPU的话,建议不要启用这两个模型。 以下是完整的更新列表说明。 一、重磅:新增 Qwen3-ASR 系列模型 本次更新的核心亮点是引入了 Qwen3-ASR 系列模型,提供三种规格: 模型 参数量 适用场景 Qwen3-ASR-0.6B 0.6B 轻量部署,显存有限 Qwen3-ASR-1.7B 1.7B 平衡性能与资源 Qwen3-ASR-Flash 1.7B 1.7B 流式低延迟场景 显存优化亮点: 二、架构重构:更清晰、更可维护 1. ASR 模型注册表(asr_registry.py) 全新设计的模型注册机制,统一管理所有 ASR 后端的注册、实例化和生命周期。 2. BaseASR 参数封装 将 BaseASR […]
语音识别
当前最新版本:v2.5.5,已经上传到pypi,有需要的同学可以下载安装来体验一下。 安装:pip install oddasr运行:oddasrDemo: http://localhost:9002 默认启动只支持2路实时转写,再加1路离线转写。可通过自行修改配置文件中的最大实例数来放大。 自定义配置启动 项目地址:https://github.com/oddmeta/oddasr文档地址:https://oddmeta.net/docs/oddasr/ 一、本次更新的亮点 本周的核心工作集中在说话人分离(Speaker Diarization)的配置化与请求级可控上,同时围绕实时转写首字时延 / 返回速度、低配硬件可运行性、Web 前端体验做了多处优化,并修复了 WebSocket 在 HTTPS 环境下的兼容性问题。 这个版本里主要是这几个功能: 二、新功能(Feat) 下面是更新的具体的新功能。 1. 说话人分离 4 个核心参数落地 新增 preset_spk_num / max_num_spks / merge_thr / spk_mode 四参数,打通了 配置文件 → 离线转写 API → Web 前端 的完整链路。 参数 默认值 作用 对应 FunASR 内部机制 preset_spk_num 0 […]
其实版本陆陆续续有递交到pypi,只是今天做一个阶段性的总结。当前版本号为v2.5.1,近期的一些修改主要对 OpenAI API 的兼容性做了一些增强,同时更新覆盖实时性、准确率、功能广度、工程稳定性四个维度。 最新版本 v2.5.1,已经上传到pypi,有需要的同学可以下载安装来体验一下。 安装:pip install oddasr运行:oddasr 一、实时转写:首字时延从 1.5~2s 砍到 ~0.5s 在 v2.5.1 更新中最值得关注的性能优化 同时新增配置项 streaming_buffer_chunk_size(默认 4800,即 300ms 缓冲),方便手动调优服务端缓冲策略。 为了方便查看和统计时延,本次还为转写流程中每一个重点功能都加上了时延统计,便于线上观测与回归对比。 二、新功能上线 1. 热词(Hotwords)支持 Paraformer / SenseVoice 后端现已支持热词功能,可在转写时注入业务专有词,显著提升专有名词、人名、术语的识别准确率。 服务端做了优化:只在热词实际发生变化时才记录日志(比较新旧值),避免高频音频传输路径上日志刷屏。 2. diarized_json 返回格式 在 OpenAI 兼容的 response_format 基础上,新增 diarized_json,返回带说话人角色的结构化结果,方便直接消费”谁在什么时候说了什么”。老接口里说话人角色分离的接口依然可用:response_format:spk。 3. 字词级时间戳(word-level timestamps) verbose_json 模式下支持 OpenAI 兼容的 word-level 时间戳请求参数,可控制返回文本是否带每个字的时间戳,并修复了音字对照时间戳错位、英文单词间空格导致解析异常等问题。 4. 多种音频格式 […]