阿里云 – OddMeta

一、前言前前后后的给小落同学加了许多的MCP。但是这些功能之前一直在我本地的小落同学上跑，部署在阿里云ECS上的小落同学因为买的ECS配置太低（99元一年的2H2G特惠主机）跑不动，这个周末在家没事做，想想是不是干脆用frp让公网上的小落同学也可以把这些MCP也都给支持起来。所以这个周末的任务就是：把原先一直在我本地电脑上跑的小落同学的MCP Server部署到公网，并让阿里云上的小落同学来访问和使用。目前小落同学支持的MCP包括：既然想了，那不管有没有人用小落同学，咱先给它配上去再说。二、MCP Server可配置化 1. 新增ODDMCP配置在小落同学的.env环境变量里新增mcp相关环境变量配置 2. 同步调整MCP Server和MCP Client中与MCP相关的配置把原先固定的localhost的地址，改成从环境变量中获取。 1）代码：oddmcp_server.py 2）代码：oddmcp_client.py 3）代码：oddmcp_status_callback.py 4）oddagent 同步的时候发现几个新的MCP Server功能还没同步到小落同学上的oddagent，也顺手改了一下。三、利用frp来做跳转 ODDMCP用了两个端口，一个是MCP Server所绑定的9600端口，另一个是每个在MCP运行过程中的一些实时进展状态回调时所使用的redis。 1. 客户端配置代码：frpc-https.toml 杀掉并重新启动 frpc 2. 服务端口配置客户端修改并新增了这两个端口，并且重启了frpc之后，先到ECS服务器端查看一下，端口状态是否都正常。如果都有正常绑定了，说明frp已经可以工作了。需要注意的是：服务绑定地址应该是 0.0.0.0:9600，而不是 127.0.0.1:9600（后者只允许本地访问）。四、阿里云ECS配置配置好frp后，还需要让阿里云ECS放行这两个端口。 1. 修改ECS安全组配置打开浏览器，登录阿里云控制台，进入安全组配置，并在其中新增、放行9600和63579这两个TCP的端口。阿里云控制台上的功能比较多，不常用的话，可能要找地址找半天。由于忘记功能名字了，搜索也不好搜索，呵呵。为方便记录，特把安全组的链接地址也贴一下：https://ecs.console.aliyun.com/securityGroup/region/cn-shanghai 2. 放行防火墙打开xshell，ssh登录上ECS服务器，查看是否放行 9600/tcp 如果是centos/openEuler操作系统： […]

LLM ProjectXL Utilities

把你的MCP Server部署到公网，让阿里云上的应用来访问和使用

前两天试了一下小红书开源出来的FireRedASR，整体感觉是小红书团队只是把关键的语音识别的模型开放出来了（也只开放了-L的模型），但是由于缺了一些前处理(语音VAD检测）、后处理（标点，多人语音聚类，热词等）相关的功能，普通用户拿到他们这个模型也根本没法直接拿来用，所以个人的观点是对于开源FireRedASR来说，小红书团队的诚意是不够的。而光嘴巴说他们诚意不够是不能令人信服的，所以咱把阿里在2年多前开源出来的FunASR拿出来介绍一下，诚意够不够让大家自己体会。一、FunASR介绍 FunASR是一个由阿里巴巴达摩院开发的开源语音识别工具包，旨在为学术研究和工业应用提供桥梁。它支持多种语音识别功能，包括语音识别（ASR）、语音端点检测（VAD）、标点恢复、语言模型、说话人验证、说话人分离和多人对话语音识别。FunASR提供了便捷的脚本和教程，支持预训练模型的推理与微调，帮助用户快速构建高效的语音识别服务。支持各种音视频格式输入，可以把几十个小时的长音频与视频识别成带标点的文字，支持上百路请求同时进行转写支持中文、英文、日文、粤语和韩语等。在线体验：https://www.funasr.com/ 注： FunASR是支持GPU推理加速的，不像阿云早先的一个私有云版本的ASR引擎那样，只用CPU来推理的。二、FunAsr核心功能 1. 功能列表 2. 离线语音识别拥有完整的语音识别链路，结合了语音端点检测、语音识别、标点等模型，可以将几十个小时的长音频与视频识别成带标点的文字，而且支持上百路请求同时进行转写。输出为带标点的文字，含有字级别时间戳，支持ITN与用户自定义热词等。 3. 实时听写 FunASR实时语音听写软件包，集成了实时版本的语音端点检测模型、语音识别、语音识别、标点预测模型等。采用多模型协同，既可以实时的进行语音转文字，也可以在说话句尾用高精度转写文字修正输出，输出文字带有标点，支持多路请求。依据使用者场景不同，支持实时语音听写服务（online）、非实时一句话转写（offline）与实时与非实时一体化协同（2pass）3种服务模式。三、安装部署 1. Requirements 2.创建虚拟环境 3. 安装【必选】torch+torchaudio安装我本次测试是直接用pip来安装的，省去docker相关安装、拉取的时间。其中需要注意的是如果你是一个全新的环境，没有torch, torchaudio的环境的话，需要先安装一下这两个。如果是国内的话可以考虑加速一下建议安装一下。不安装的话用torchaudio也能跑，但是ffmpeg更佳，毕竟是专业做这个的。没安装ffmpeg会有这个Notice: 4. 下载模型常规的环境变量，指定huggingface和modelscope的cache路径，并为huggingface做个国内的加速。 5. 下载测试音频文件在开始测试之前，你需要准备一些测试用的音频，可以直接用阿里云提供的先把功能跑通，然后再去用一些公开的测试集，或者是你自己的测试来测试FunASR的效果。阿里云上的测试文件：四、测试运行在安装好FunASR，下载好模型，下载好测试文件后，可以开始跑正式的测试了。 1. ASR转写从这个结果里可以看到，FunASR的标点、断句都做的非常好。音字对照的时间戳也都可以给你标出来了，基本上就是它所宣称的工业级别的了，有了这些基本上可以让你自行去扩展实现各种你需要的业务了。 2. VAD检测对于语音转来说的，非常重要的一个前处理，尤其是针对文件转写来说，通常都需要先检测一下VAD，如果没有VAD，那么那一段时间的音频可以直接扔掉；另外，如果需要将大文件做切片的时候也需要根据VAD来做切片。哪怕转写出来文字后，要进行分段处理，那VAD的情况也是一个重要的参考指标。 3. 标点恢复我相信没人想要一陀没有任何标点符号的文本吧。FunASR的ct-punc模型可以帮你处理标点符号的恢复。 4. 说话人验证如果你想做一些说话人验证的产品和功能的时候，FunASR的这个speaker-verification模型可以直接拿来用。 […]

Speech Tech