精通
英语
和
开源
,
擅长
开发
与
培训
,
胸怀四海
第一信赖

最近关注AI边缘算力盒子,一种小型的服务器接入监控摄像头的视频流就可以分析出AI大模型算法输出的结果。这种小模型里面部署的有AI大模型,有一些自学习的机制,通过几个图片里面的训练,就生成一种识别算法,然后这个算法就会迅速的上线,迅速的去结合摄像头的实时数据流,分析出结果。
当我咨询这个厂家的技术人员时,问他们我们自定义的算法能不能部署上去,他们说不能,里面硬件软件都是做好的,不能有深度的定制扩展。
其实我想做的是在上面部署另外一个大模型,用另外一套机制来进行识别,这个他们边缘算力盒子,当然不支持。
这类代自训练的人工智能大模型部署是相对中级的类别,初级的类别就是部署简单的大模型的库,包含模型权重文件、模型架构与加载代码和核心推理引擎。中级的另外一类是混合智能架构,有多个AI大模型共同部署,共同去解决一类复杂的行业问题。高级的模式有插件部署和Agent的进化式部署智能体部署,顶端最难的就是把大模型的代码下载后改代码改参数重新编译,对自己的数据再训练,用自己的特征库来部署。
锐英源软件用过混合智能架构模式,使用了YOLO-v8和FastSAM两种大模型来处理图片数据,在识别中,调整了很多步骤的model参数,才达到了预想的效果。
今天又用初级的模式使用了BGE-M3大模型,下载了特征库的文件,第1次下载的有438兆,第2次下载有2.2G,里面看到了Transformer术语和各类参数,这比某些视频上只讲Transformer的原理,讲到KPV向量相关的术语更有用。使用BGE也是DeepSeek查询时推荐的,但是我本来就对于这类推荐有一种要分析待定的看法,所以我今天就特意试了一下,BGE在结果上是没有满足我要求的,我们后续的开发是需要再重新整理思路,有可能是现在流行的未必是和你要求最适合。
锐英源软件在几年前用Kaldi进行语音识别的训练和识别,因为处理的不是汉语,是蒙语,所以对模型的参数进行了调整,结合语料数据进行了反复的改进,才找到了一个相对友好的参数框架。这类处理复杂数据的场景,也算是中级里面相对较难的一种吧。在具体调优的过程中和Kalid的创始人及Kalid的爱好者进行了深度的交流,通过邮件列表进行了反复的对话,中间还回答过一些朋友的问题,下面是图片:

里面的396806883@qq.com,就是锐英源软件的邮箱。
当时为了训练,专门买了英伟达的GeForce RTX 2060显卡,显存6个G,计算机上装了多操作系统,有Windows10也有Ubuntu,训练的时候经常训练几天几夜,非常的枯燥,但又没有办法。
从上面历史总结看,锐英源软件恰好集齐了语音、图片和文本的人工智能大模型部署经验,这深刻理解到不同的数据,有不同的参数,有些时候不能用原来的经验去照搬,自己遇到问题还是要仔细认真分析。现在Agent智能体大模型部署里数据更麻烦,这些经验在逐步提升。
关于Kaldi的技术文章,在锐英源的网站上有非常多,我记得印象最深的是有一个CUDA下载慢这样的文章,这个文章呢被很多网友都搜索到了,也帮助他们解决了一些问题。
最后打个广告,如果某些公司想推广自己的开源大模型,特别是向国外推广自己的混元大模型,非常需要和国外的技术爱好者交流回答问题,这些运营可以转给锐英源软件来做,欢迎咨询。