VC编程实现文本语音转换

更新时间：2023-07-28 11:47:01 阅读量：实用文档文档下载

说明：文章内容仅供预览，部分内容可能不全。下载后的文档，内容与下面显示的完全一致。下载之前请确认下面内容是否您想要的，是否完整无缺。

vc编程实现模拟信号的叠加推荐度：
相关推荐

VC编程实现语音识别的实例

VC编程实现文本语音转换

文本语音（Text-to-Speech，以下简称TTS），它的作用就是把通过TTS引擎把文本转化为语音输出。本文不是讲述如何建立自己的TTS引擎，而是简单介绍如何运用Microsoft Speech SDK 建立自己的文本语音转换应用程序。

Microsoft Speech SDK简介

Microsoft Speech SDK是微软提供的软件开发包，提供的Speech API （SAPI）主要包含两大方面：

1． API for Text-to-Speech

2． API for Speech Recognition

其中API forText-to-Speech，就是微软TTS引擎的接口，通过它我们可以很容易地建立功能强大的文本语音程序，金山词霸的单词朗读功能就用到了这写API，而目前几乎所有的文本朗读工具都是用这个SDK开发的。至于API for SpeechRecognition就是与TTS相对应的语音识别，语音技术是一种令人振奋的技术，但由于目前语音识别技术准确度和识别速度不太理想，还未达到广泛应用的要求。

Microsoft Speech SDK可以在微软的网站免费下载，目前的版本是5.1，为了支持中文，还要把附加的语言包（LangPack）一起下载。

为了在VC中使用这SDK，必需在工程中添加SDK的include和lib目录，为免每个工程都添加目录，最好的办法是在VC的

Option-＞Directoris立加上SDK的include和lib目录。

一个最简单的例子

先看一个入门的例子：

#include ＜sapi.h＞

#pragma comment(lib,"ole32.lib") //CoInitialize CoCreateInstance需要调用ole32.dll

#pragma comment(lib,"sapi.lib") //sapi.lib在SDK的lib目录,必需正确配置

int main(int argc, char* argv[])

{

ISpVoice * pVoice = NULL;

//COM初始化：

if (FAILED(::CoInitialize(NULL)))

return FALSE;

//获取ISpVoice接口：

HRESULT hr = CoCreateInstance(CLSID_SpVoice, NULL, CLSCTX_ALL, IID_ISpVoice, (void **)&pVoice); if( SUCCEEDED( hr ) )

VC编程实现语音识别的实例

{

hr = pVoice-＞Speak(L"Hello world", 0, NULL);

pVoice-＞Release();

pVoice = NULL;

}

//千万不要忘记：

::CoUninitialize();

return TRUE;

}

短短20几行代码就实现了文本语音转换，够神奇吧。SDK提供的SAPI是基于COM封装的，无论你是否熟悉COM，只要按部就班地用CoInitialize()，CoCreateInstance()获取IspVoice接口就够了，需要注意的是初始化COM后，程序结束前一定要用CoUninitialize()释放资源。

IspVoice接口主要函数

上述程序的流程是获取IspVoice接口，然后用ISpVoice::Speak（）把文本输出为语音，可见，程序的核心就是IspVoice接口。除了Speak外IspVoice接口还有许多成员函数，具体用法请参考SDK的文档。下面择要说一下几个主要函数的用法： HRESULTSpeak(const WCHAR *pwcs,DWORD dwFlags,ULONG *pulStreamNumber);

功能：就是speak了

参数：

*pwcs 输入的文本字符串，必需为Unicode，如果是ansi字符串必需先转换为Unicode。

dwFlags 用来标志Speak的方式，其中SPF_IS_XML 表示输入文本含有XML标签，这个下文会讲到。

PulStreamNumber 输出，用来获取去当前文本输入的等候播放队列的位置，只有在异步模式才有用。

HRESULT Pause ( void );

HRESULT Resume ( void );

功能：一看就知道了。

HRESULT SetRate(long RateAdjust );

HRESULT GetRate(long *pRateAdjust);

功能：设置/获取播放速度，范围：-10 to 10

HRESULT SetVolume(USHORT usVolume);

HRESULT GetVolume(USHORT *pusVolume);

VC编程实现语音识别的实例

功能：设置/获取播放音量，范围：0 to 100

HRESULT SetSyncSpeakTimeout(ULONG msTimeout);

HRESULT GetSyncSpeakTimeout(ULONG *pmsTimeout);

功能：设置/获取同步超时时间。由于在同步模式中，电泳Speak后程序就会进入阻塞状态等待Speak返回，为免程序长时间没相应，应该设置超时时间，msTimeout单位为毫秒。

HRESULT SetOutput(IUnknown *pUnkOutput,BOOL fAllowFormatChanges);

功能：设置输出，下文会讲到用SetOutput把Speak输出问WAV文件。

这些函数的返回类型都是HRESULT，如果成功则返回S_OK，错误有各自不同的错误码。

使用XML

引自: /web/198/22269.htm

个人认为这个TTSapi功能最强大之处在于能够分析XML标签，通过XML标签设置音量、音调、延长、停顿，几乎可以使输出达到自然语音效果。前面已经提过，把Speak参数dwFlags设为SPF_IS_XML,TTS引擎就会分析XML文本，输入文本并不需要严格遵守W3C的标准，只要含有XML标签就行了，下面举个例子： ……

pVoice-＞Speak(L"＜VOICE REQUIRED=''NAME=Microsoft Mary''/＞volume＜VOLUME LEVEL=''100''＞turn up＜/VOLUME＞", SPF_IS_XML, NULL);

……

＜VOICE REQUIRED=''NAME=Microsoft Mary''/＞

标签把声音设为Microsoft Mary，英文版SDK中一共含有3种声音，另外两种是Microsoft Sam和Microsoft Mike。 ……

＜VOLUME LEVEL=''100''＞

把音量设为100，音量范围是0～100。

另外：标志音调（-10～10）：＜P99vCH MIDDLE="10"＞text＜/P99vCH＞

注意：" 号在C/C++中前面要加 \ ，否则会出错。

本文来源：https://www.bwwdw.com/article/mshm.html

相关文章：