4. TM
更新: 2026/7/21 字数: 0 字 时长: 0 分钟
4.1 列表页面

列表页面分为菜单栏、操作栏以及数据栏;
操作栏:在操作栏分别有新增“Create”、搜索“Search”以及重置“Reset”功能;
数据栏:数据栏表格分别按照语料库名称“TM Name”、客户“Client”、领域“Industry”、语言对“Language Paris”、创建时间“Create On”、更新时间"Update On",创建人“Create By”等信息分页显示了语料库列表;

- 语料库排序:在表格中提供了按照“TM Name”、“Create On”列排序功能,点击对应列右侧按钮,实现不同排序规则;

4.2 创建语料库
- 页面左上角有“新建 +”按钮,点击可打开新建TM的弹窗(图1 所示弹窗位于页面中心)。
- 填写基础信息(弹窗第一页:基础设置)
- 弹窗标题:新建翻译记忆库
- 必填项(页面上带红色 *):
- TM名称(TM名称 *):请输入此记忆库的名称(示例:Client123_EN-ZH_TM)。
- 节点名称(节点名称 *):从下拉列表选择所属节点(例如 Client1092、Client173 等)。
- 领域(领域 * / Industry):从下拉列表中选择业务领域(例如 IT & Internet、Video Games 等)。
- 源语言(源语言 * / Source Language):选择源语言(例如 English)。
- 目标语言(目标语言 * / Target Language):选择目标语言(例如 Chinese (Simplified))。
- 可选项:
- 标签(标签):用于快速筛选/分类的标签,可多选/输入。
- 备注(备注 / Comment):填写补充说明。
- 操作按钮(弹窗底部):
- 取消:放弃本次新建,关闭弹窗。
- 下一步:校验当前页必填项通过后进入“高级设置”页面。

配置高级设置(弹窗第二页:Advanced Setting,参见图2)
- 页面顶部(可勾选项):
- 启用基于字符的相似搜索:是否开启字符级相似匹配(根据业务需要选择,开启可提升模糊匹配命中率,但可能带来误匹配)。
- 资源模板(资源模板 *):选择TM的资源/模板配置(默认 Default)。资源模板详细设置见#4.6
- 识别(识别模块):可以勾选识别类型,例如 日期、时间、数字、首字母缩写词、变量、度量单位、字母数字字符串等。识别项会影响分词和匹配逻辑。
- 将满足下列条件的字计为一个字:用于定义连续字符或带连字符的处理规则(例如“有连字符”、“有短横线连接”、“包含编号”)。
- 语言配置表(下部表格):按语言列出当前选择的源语言和目标语言,每行可以配置:
- 语言(Language)
- 变量(Variable)
- 缩写(Abbreviation)
- 序列(Sequence)
- 断句规则(Segmentation rules) 每列默认值为 Default,点击对应单元格可以编辑该语言的具体规则。
- 操作按钮(弹窗底部):
- 取消:放弃创建并关闭弹窗(同第一页的取消)。
- 返回:返回“基础设置”页以修改已填信息。
- 保存:保存并创建该翻译记忆库(必须满足所有必填项与校验)。

成功后页面顶部会弹出创建成功提示(示例提示:创建成功),系统自动跳转至新创建的语料库详情页面(TM详情页),可以在详情页查看统计、导入/导出语料、编辑设置等操作。
4.3 语料库详情页面

4.3.1 添加语言
- Add Language:点击“Add Language”按钮,弹出添加语料库页面;选择要添加的目标语种“Target Language”,点击“Save”按钮进行保存;点击“Cancel”按钮取消添加;

4.3.2 分享TM
选择用户分享TM并设置分享有效期,该用户在有效期内可以对被分享的TM进行操作。(有效期为空时表示永久有效。)

4.3.3 编辑基础信息
编辑TM可以针对TM名称,领域、标签、备注等信息进行二次编辑

4.3.4 删除语料库
点击删除语料库按钮图标,系统弹出提示层,点击“删除”按钮,系统将删除语料库;

4.3.5 修改识别参数
针对TM识别项等高级信息可以在检查参数中进行修改
修改后点击保存按钮进行信息的调整。同时如果当前tm库中存在条目,则会重新计算条目索引信息。
其中语言资源模板相关项内容见#4.6 语言资源模板


4.3.6 批量导入

批量导入时可选择多个文件或文件夹进行导入,选择文件后系统将提示语种映射关系,可根据实际情况选择

4.3.7 批量导出
点击导出按钮,弹出导出设置弹窗,可选择多个语种进行同时导出
- 每个语种一个TMX文件:导出3个语种则有3个tmx文件
- 单个TMX文件包含多个语种:导出3个语种1个tmx文件

4.3.8 语种操作

导入
导入语料库,鼠标悬浮语言对右侧按钮弹出选项,点击“Import”按钮,弹出导入选项卡,上传文件以及修改选项(带红色*必填),点击“Save”按钮,系统将执行导入操作,点击“Cancel”按钮取消导入操作;导入成功后系统弹出信息提示;

导出
导出该语言对语料库,鼠标悬浮语言对右侧按钮弹出选项,点击“Export”按钮,系统弹出导出提示层;等待系统导出成功后给出提示;

清除
清除会将该语种下所有条目进行删除
4.3.9 最新操作日志
操作日志中记录了当前tm导入和导出的信息,可以根据日志查看当时操作状态等信息,同时导出文件也可以点击操作进行下载

4.3.10 Find & Replace

语料库查找和替换功能页面,该页面提供了在线语料库编辑功能;
语言对切换栏:因语料库内会有多个语言对语料库,所以提供了语言对切换功能,第一个不能更改语言为源语言、第二个为目标语言;选择目标语言后,在后期操作中都是针对本语言对里的语料进行查找和替换;

查找和替换搜索区域:该区域分别按照原文“Find in Source”、译文“Find in Target”、忽略大小写“Case sensitive”、整词匹配“Whole word”、使用正则表达式"Use regular expression",更新时间“Updated On ”、更新人“Updated By”、原文最小长度“Minimun Length of Source”等条件查询语料库,默认情况下点击“Search” 按钮,将提示请输入原文或译文“Please input source or target”,输入后点击“Search”按钮,下方表格中将按照搜索条件展示语料库;

替换操作栏:替换操作栏左侧选择要替换的原文或译文(搜索原文只能替换原文、搜索译文只能替换译文),右侧为替换按钮,分别取消更改“Discard Changes”、替换所有“Replace all”、提交更改“Submit Changes”;

切换要替换的原文或译文:
“Replace all”替换所有查找出的语料,界面根据替换值,显示替换后语;

“Submit Changes”将以替换的语料提交到数据库,并更新语料库;

“Discard Changes”取消替换,将以替换的语料取消替换;

数据展示栏:数据展示栏按照搜索条件查找出语料库符合条件的语料,并将原文“Source”、译文“Target”、更新人“Updated By”、更新时间“Updated On”、操作栏等信息进行显示;

替换按钮:替换按钮是将替换操作栏左侧输入的替换值替换到当前行的语料中,并更改显示颜色以及替换按钮;替换后按钮将变为撤销按钮,点击撤销按钮将放弃对语料进行替换,点击替换按钮后,点击操作栏右侧中的“Submit Changes”将提交到数据库,并更新语料库,


4.3.11 Linguist Modified
PM开启译员译后编辑TM,译员编辑完成后,PM对译员编辑内容进行同意或拒绝,同意后内容送入到语料库,拒绝内容将作废

4.4 语料库内容搜索
通过菜单进入内容搜索后,可针对所有TM进行内容的搜索
可通过选择客户、源语种、目标语种、原文或译文来进行搜索 
4.5 语料库对齐
主要用于将已有的源语言文本和其对应翻译文本进行段落或句级匹配,生成可供重复使用的翻译记忆库(TM),线上系统增加导出TMX文件以及直接导入现有TM库中
系统根据PM上传的原始文件和目标文件根据分段规则进行提取,提取后将结果展示在页面当中,同时对结果进行修改后,点击导出或导入按钮进行结果的确认
选中:①点击单元格:选中单元格;②点击序号:选中整行;③按住Shift(或Ctrl)并单击:可选中多个单元格(行)。
编辑:双击单元格进入编辑状态,可编辑修改单元格内容。
合并:选中某单元格(行),按住Shift(或Ctrl)并选中其余需要合并的单元格(行),点击合并,完成操作。
拆分:双击单元格进入编辑状态,鼠标单击需要拆分的位置,点击拆分,完成拆分句对操作。
上移:选中(可多选)单元格(行),点击上移,完成操作。
下移:选中(可多选)单元格(行),点击下移,完成操作。
调换:选中(可多选)单元格(行),点击调换,即可完成同一行左右两列内容调换。
插入:选中某单元格(行),点击插入,完成操作。 单选一行,不支持多行插入,如果不选就插入最顶部一行
删除:选中要删除的单元格(行),点击删除,完成操作。
AI:点击AI选项后将进行调用大模型进行语义化的对齐,对齐后将结果显示在表格中。

4.6 语言资源模板
语言资源模板含有一组已经过修改的语言资源,以满足您的需求。您可以在创建新翻译记忆库 (TM) 时选择模板,以将模板中存储的设置应用至 TM。
系统提供一组默认的语言资源。若默认的语言资源符合您的需求,则无需创建语言资源模板。您可以在系统中创建和维护语言资源模板。

4.6.1 创建语言资源模板
点击新建按钮,进入创建页面
必填项(页面上带红色 *):
模板名称(模板名称 *):请输入此模板的名称(示例:Client123_EN-ZH_TM)。
节点(名称 *):从下拉列表选择所属节点(例如 Client1092、Client173 等)。
描述:输入对该模板的备注信息
区分(区分模块):可以勾选识别类型,例如 日期、时间、数字、首字母缩写词、变量、度量单位、字母数字字符串等。识别项会影响分词和匹配逻辑。
将满足下列条件的字计为一个字:用于定义连续字符或带连字符的处理规则(例如“有连字符”、“有短横线连接”、“包含编号”)。
语言:可以添加多个语种,进行不同语种的设置
变量:当 TM 被应用至句段文本时,部分项目将被自动翻译。如果不希望翻译特定项目,可将该项添加至变量列表。例如,您可能不希望翻译某个公司名称。将项目添加至“变量”列表会将该项目标识为不应翻译的内容。默认情况下,该列表为空。
缩写:在分割文本时,句点代表了句段的结束。但是,句点也会出现在缩写中,并且会导致原文断句不当。为避免此类问题,为原文断句时,已识别缩写后的句点将被忽略,列表中包含最常见、最常用的缩写,如 max.、min. 和 usd.您可以编辑此列表,添加自己的缩写或删除现有缩写。
序列词:最常见的序列词是句点和逗号。通常情况下,断句规则使用句点和逗号来解析基于的整个翻译记忆库 (TM)。但是,如果在某些短语中为句点和逗号指定了序列词状态,则这些上下文将被忽略,且不会干扰 TM 解析机制。例如,您可能会有一个日期条目 23.03.2000。您不希望 TM 将句点解释为句点,因此您可以在该上下文中赋予它序列词状态。
断句规则: 断句设置可定义翻译记忆库 (TM) 或项目如何将原文文本划分为句段。
断句规则由指定句段的正则表达式定义。
通常,句段与句子一致,在这种情况下正则表达式将指定构成句子的文本格式。
在任一项目中,相同语言对可使用具有不同断句规则的多个主 TM。指定例外情况的规则
缩写列表。这包括以句号 (.) 结束的缩写列表,例如“etc.”。“etc.”末尾的句号不一定表示句子结束,有时可能如此。
序列词列表。与缩写类似,序列词中的句点也不一定表示句段结束:当后面接名词时,一组数字后跟句点(例如 23.)表示序列词 (23rd),而不是句子结束。例如 23.April 可能表示 23rd April(4 月 23 日)。序列词列表是此类名词的列表。
## 示例:简单的断句规则
```
\.+[\p{Pe}\p{Pf}\p{Po}"]*
```
此正则表达式以非常简单的方式指定句段。它会将所有字符匹配到结束句段的标点符号。
结束、最后和其他标点符号是指由以下代码定义的 Unicode 类别:
**\p{Pe}** 指定结束标点符号。
**\p{Pf}** 指定最后的引号。
**\p{Po}** 指定其他标点符号。日期/时间:在对文本进行分割会使用每种源语言和目标语言的默认日期和时间列表。该列表可确保源语言的日期和时间格式在目标语言中得到正确识别和本地化。
数字:在对文本进行断句对每种源语言和目标语言使用默认的数字格式列表。该列表可确保源语言中的数字格式在目标语言中得到正确识别和本地化。
度量单位:在对文本进行断句时,会对每种源语言和目标语言使用默认的度量单位列表。该列表可确保源语言中的度量单位在目标语言中得到正确识别和本地化。
货币:在对文本断句,会使用每种源语言和目标语言的默认货币格式(符号和符号放置)列表。该列表可确保源语言中的货币格式在目标语言中得到正确识别和本地化。

填写必要信息后点击保存按钮,信息被保存至模板
4.6.2 编辑语言资源模板
点击编辑语言资源模板按钮,进入信息编辑页面

编辑项同新增

4.6.3 删除语言资源模板
点击删除语言资源模板,可进行模板的删除

