> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-partner-nodes-consolidate.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabsSpeechToText - ComfyUI Built-in Node Documentation

> ElevenLabs 语音转文本节点使用 ElevenLabs API 将音频转写为文本。

ElevenLabs 语音转文本节点使用 ElevenLabs API 将音频转写为文本。它支持自动语言检测、说话人分离（识别不同说话人）以及音频事件标记（在转写文本中标注笑声、音乐等声音）。

## 输入

### 通用输入

| 参数     | 描述                                                               | 数据类型           | 必需 | 范围             |
| ------ | ---------------------------------------------------------------- | -------------- | -- | -------------- |
| `模型`   | 用于转写的模型。选择此模型将显示其他参数。                                            | DYNAMIC\_COMBO | 是  | `"scribe_v2"`  |
| `音频`   | 要转写的音频。                                                          | AUDIO          | 是  | -              |
| `语言代码` | ISO-639-1 或 ISO-639-3 语言代码（例如 'en'、'es'、'fra'）。留空以进行自动检测。（默认：""） | STRING         | 否  | -              |
| `说话人数` | 要预测的最大说话人数。设置为 0 以自动检测。（默认：0）                                    | INT            | 否  | 0 - 32         |
| `种子`   | 用于复现的随机种子（不保证确定性）。（默认：1）                                         | INT            | 否  | 0 - 2147483647 |

### Scribe v2 输入

选择 `"scribe_v2"` 模型时显示以下参数。

| 参数                       | 描述                                                  | 数据类型    | 必需 | 范围                                        |
| ------------------------ | --------------------------------------------------- | ------- | -- | ----------------------------------------- |
| `tag_audio_events`       | 在转写文本中标注（笑声）、（音乐）等声音。（默认：False）                     | BOOLEAN | 否  | -                                         |
| `diarize`                | 标注当前说话人是谁。（默认：False）                                | BOOLEAN | 否  | -                                         |
| `diarization_threshold`  | 说话人分离灵敏度。值越低，对说话人变化越敏感。仅在启用 `diarize` 时使用。（默认：0.22） | FLOAT   | 否  | 0.1 - 0.4                                 |
| `temperature`            | 随机性控制。0.0 使用模型默认值。较高的值会增加随机性。（默认：0.0）               | FLOAT   | 否  | 0.0 - 2.0                                 |
| `timestamps_granularity` | 转写字词的时间戳精度。（默认："word"）                              | COMBO   | 否  | `"word"`<br />`"character"`<br />`"none"` |

**注意：** 启用 `diarize` 时，`num_speakers` 不能设置为大于 0 的值。您必须禁用 `diarize` 或将 `num_speakers` 设为 0。

## 输出

| 输出名称      | 描述                                      | 数据类型   |
| --------- | --------------------------------------- | ------ |
| `文本`      | 从音频转写出的文本。                              | STRING |
| `语言代码`    | 检测到的音频语言代码。                             | STRING |
| `单词 JSON` | 包含详细词级信息的 JSON 格式字符串，包括时间戳以及（如启用）说话人标签。 | STRING |

> 本文档由 AI 生成。如果您发现任何错误或有改进建议，欢迎贡献！ [在 GitHub 上编辑](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/zh.md)

***

**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830`
