특정 분야에 특화된 사람
고정밀 AI 번역
발전하고 싶어
다국어 챗봇
정확성
키우고 싶어
대화와 질의응답 시간에,
나는 그 진술을 예측하고 싶다.
동남아시아 국가들의 언어들
서신
번역 말뭉치
찾아보기
산업별 또는 전문 분야별
특수한 분야
용어집을 참고하세요
나는 만들고 싶어
1980년대부터 우리는 기계 번역을 개발해왔습니다.
저희는 대기업에 이중언어 코포라를 제공하는 데 풍부한 경험을 가지고 있습니다.
수년간의 경험과 노하우를 바탕으로 문제 해결에 기여합니다
저희는 다국어 말뭉치를 제공합니다.
관광, 의료, 법률, 금융, 지적 재산권 등.
다양한 분야의 병행 말뭉치를 보유하고 있습니다.
기자회견, 질의응답 세션 및 기타 대화 형식
번역 코퍼라도 제공합니다.
우리는 100만 쌍이 넘는 번역 코퍼라를 제공할 수 있습니다!
사용 중인 번역 지원 도구입니다
또한 번역 메모리로도 사용할 수 있습니다.
일본어에서 영어로 번역된 데이터 외에도,
영어에서 동남아시아 언어 및 희귀 언어까지
우리는 번역된 평행 코퍼스를 보유하고 있습니다.
평행 말뭉치는 각 언어의 원어민에 의해 결정됩니다.
번역된 것이기 때문에 각 언어마다 고유합니다.
미묘한 차이와 진부한 표현들이 반영됩니다.
필드와 데이터 타입 외에도,
번역 방향도 관리하기 때문에,
원하는 번역 말뭉치를 추출해 드릴 수 있습니다.
또한 다국어 전문 용어 생성도 제공합니다.
공장과 작업 현장에서 안전한 작업을 위한 중요한 예방 조치를 업계별 대화 형식으로 제공합니다.
농업, 임업, 수산과 같은 1차 산업부터 경제, 금융, IT, 원자력 발전 보고서에 이르기까지 폭넓은 분야를 다룹니다.
우리는 입국 및 거주 관련 법률, 의료 현장에서의 의료 면접 등 일본에 입국 및 거주하는 외국인에게 필요한 다국어 데이터를 제공합니다.
주요 통신 회사의 연구 부서
/방송국 연구소
/ AI 기반 기계 번역 엔진 개발 회사
그리고 그 외
기계 번역과 다국어 생성형 AI 개발 및 조정에 있어 이중언어 말뭉치의 필요성이 꾸준히 증가하고 있습니다. 더욱이 번역가들이 새로운 분야에서 번역에 뛰어들 때, 자체 축적된 번역 기억은 번역 작업의 효율성을 크게 향상시킵니다. 반면, 체계적인 이중언어 말뭉치를 내부적으로 수집하는 것은 쉽지 않습니다; 외부에서 데이터를 수집하고 의도된 산출물과 번역 작업 개발에 집중하는 것이 더 효율적입니다.
다음 여섯 가지 포인트는 병행 코퍼스를 선택할 때 핵심 포인트입니다.
1) 언어 조합
2) 필드
3) 품질
4) 양
5) 데이터 타입
6) 맥락의 존재 여부
첫 번째 "언어 조합"은 번역자가 번역하는 언어 쌍이나 기계 번역 개발에서 훈련된 언어 쌍이 일본어와 영어인지, 아니면 일본어와 중국어인지 여부를 의미합니다. 마찬가지로, 사용하는 번역 지원 도구의 번역 메모리 등록 시 "언어 조합"이 가장 중요한 요소로 간주됩니다. 더 나아가, 더 자연스러운 표현을 찾을 때는 어떤 언어가 원문인지 판단하는 것도 중요한 요소입니다. 예를 들어, 이를 "일본-영어 평행 말뭉치"라고 부를 때조차, 일본어 원본을 영어로 번역하는 것과 영어 원본을 일본어로 번역할 때 영어 표현 유창성과 번역 배경에서 차이를 자연스럽게 느낄 수 있습니다.
2)의 '분야'는 관광, 의료, 법학, 경제학, 과학기술 등 다양한 분야를 의미합니다. 정확성이 요구되는 분야의 머신러닝 데이터를 활용하면 개발이 가속화될 수 있습니다. 특정 분야의 기계 번역 정확도를 높이기 위한 언어 모델을 구축할 때, 약 10만 쌍의 효과가 추정됩니다. 분야 또한 바이링-번역 말뭉치에서 기술 용어 사전을 만들 때 중요하다는 점은 말할 필요도 없습니다. 일본에서 요구되는 분야는 한때 관광 지향 국가라는 이름으로 인바운드 관광에 집중되었으나, 의료 분야는 입국 방문객과 거주 외국인을 위한 의료 서비스를 강화하기 위해 이중언어 말뭉치가 필요했습니다. 더 나아가, 수요는 수년에 걸쳐 비즈니스 프레젠테이션 및 설명, 학회 및 행사 강의, 그리고 이후 Q&A 세션에 사용되는 프레젠테이션 자료를 기록하는 비즈니스 분야로 이동했습니다.
세 번째 섹션에서 '품질'은 정확성을 의미하며, 이는 병렬 말뭉치가 어떻게 만들어졌는지에 따라 달라집니다. 데이터는 인간의 손으로 번역되는 것이 바람직하며, 기계 번역을 통해 번역되고 인간의 검사나 수정을 거치지 않은 경우 품질이 자연스럽게 떨어집니다. 또한, 수작업 번역 데이터에서도 한 문장이 두 개 이상의 문장으로 번역되고, 원본과 번역된 텍스트가 반드시 하나의 문장에 대응해야 하므로 품질에 영향을 미칩니다. 더욱이, 번역이 지나치게 축약되면 고품질 병렬 말뭉치로 간주될 수 없습니다.
4번째 항목의 "수"는 번역가가 번역 메모리 또는 내부 번역 지원 도구의 어휘 사전에 등록하기 위해 특정 분야에서 수만 쌍의 병렬 말뭉치를 등록하기에 충분하다. 기계 번역 엔진 개발과 같은 특정 분야의 기계 학습에서는 10만 쌍이면 충분히 효과적이라고 한다. 반면, 범용 기계 번역 엔진 개발은 수천만 쌍이 필요하다고 한다. 따라서 필요한 병렬 말뭉치 양은 응용에 따라 크게 달라진다.
5절에서 "데이터 타입"은 병렬 말뭉치를 생성하는 데 사용되는 파일이 다음 중 하나임을 의미합니다: 보고서/백서 또는 발표/기자회견/Q&A. 기계 학습 문어 언어를 원한다면 보고서나 백서를 사용하세요; 기계 학습을 원한다면 발표, 기자회견, Q&A에서 생성된 전사 말뭉치를 사용하세요. 우리의 병렬 말뭉치는 속성을 상세히 관리하므로 데이터 유형별로 병렬 말뭉치를 추출할 수 있습니다.
6)에서 '문맥의 존재 여부'는 여러 문장 사이에 의미적 연관성이 있는지 여부를 의미합니다. 특히, 사전에 등재된 예문은 특정 표수문만 포함하며 다른 예시와의 맥락이 없습니다. 따라서 이는 '문맥적'이라고 판단됩니다. 반면, 보고서는 특정 사건을 설명하는 여러 문장으로 구성되어 있어 '문맥적'으로 간주됩니다. 마찬가지로 기자회견과 질의응답 세션에서는 여러 연사가 번갈아 대화하여 '문맥이 있다'고 말할 수 있습니다. 기계 번역에만 국한되지 않고, 챗봇으로 더 정확한 답변을 생성하기 위해서는 이제 머신러닝으로 학습된 전사 말뭉치에 '맥락'이 포함되는 것이 그 어느 때보다 중요해졌습니다.
결론
병렬 기업을 선택할 때는 의도된 용도에 따라 위의 1) 지점부터 6까지를 고려해야 합니다. 특히 특정 분야의 머신러닝을 수행할 때는 품질, 데이터 유형, 맥락의 필요성을 반드시 고려해야 합니다. 귀하의 목표에 맞는 병렬 말뭉치를 활용하려면 먼저 무료 샘플 데이터를 확인해 주세요.