Santiago Valdarrama@svpino2026年9月21日 04:58这个新模型做了一些非常酷的事情: 当您说话时,它会将语音转换为文本。这与其他音频模型不同。 该模型称为 R2T2。它以小块的形式处理音频,并知道哪些单词需要立即发布,哪些单词需要更多上下文。 抱脸链接:https://huggingface.co/netease-youdao/Confucius4-R2T2打开原帖#511482