Cách nhân bản giọng nói bằng AI (và thế nào là một mẫu giọng tốt)

Đăng ngày · 6 phút đọc

Ba mươi giây âm thanh quyết định giọng nhân bản của bạn nghe ra sao trong cả năm tới. Đây là cách ghi những giây đó cho tốt.

Giọng AI nhân bản chỉ tốt bằng bản ghi âm mà nó học theo. Trên VocaTTS, mẫu giọng rất ngắn — từ 10 đến 30 giây — nên giây nào cũng quan trọng. Phòng ồn, giọng đọc đều đều hay micro bị rè đều sẽ bị “nướng” vào giọng mà bạn dùng hàng tháng trời. Tin vui là bạn không cần phòng thu. Bạn cần một góc yên tĩnh, một micro tạm ổn và vài phút chuẩn bị.

Bản nhân bản thực sự cần gì từ bạn

Bạn sẽ ghi hai bản. Bản thứ nhất là mẫu giọng: lời nói tự nhiên cho thấy giọng bạn nghe thế nào. Bản thứ hai là câu đồng ý: một câu cố định, do chính người đó đọc đúng từng chữ, xác nhận giọng thuộc về họ. Google Gemini — nơi tạo giọng — kiểm tra rằng hai bản ghi đến từ cùng một người. Câu đồng ý có 30 ngôn ngữ, hãy đọc bằng ngôn ngữ bạn nói thoải mái nhất.

  • Mẫu giọng: 10–30 giây. Nên nhắm 20–30 giây — nhiều chất liệu hơn cho giọng đầy đặn hơn.
  • Câu đồng ý: 2–30 giây, đọc đúng như hiển thị.
  • Gói trả phí (Basic trở lên). Mỗi giọng nhân bản chiếm một slot giọng riêng.
  • Nhân bản giọng chưa có ở Anh, EEA, Thụy Sĩ, Illinois và Texas. Nếu bạn ở đó, thiết kế giọng là lựa chọn thay thế.

Chọn phòng trước, rồi mới tới micro

Tiếng vọng làm hỏng giọng nhân bản nhiều hơn một chiếc micro rẻ. Phòng trống, tường cứng dội giọng ngược vào micro, và mô hình học luôn tiếng vang đó như một phần giọng bạn. Một phòng nhỏ có đồ vải mềm — phòng ngủ có rèm, tủ quần áo, thậm chí xe ô tô đỗ ở chỗ yên tĩnh — thường tốt hơn một phòng làm việc trống trơn.

  • Tắt quạt, điều hoà và mọi thứ có tiếng ù.
  • Tắt thông báo trên điện thoại và máy tính.
  • Ngồi cách micro 15–20 cm, hơi lệch sang bên để hơi thở không bị bụp.
  • Ghi vài giây im lặng trước rồi nghe lại. Nếu bạn nghe thấy tiếng phòng, giọng nhân bản cũng sẽ có.

Nên nói gì trong mẫu giọng

Mô hình học cách bạn nói chứ không học nội dung, nên hãy chọn thứ làm bật lên lối nói tự nhiên của bạn. Đọc đều đều một đoạn khô khan sẽ cho ra giọng nhân bản khô khan. Kể về điều bạn thực sự quan tâm sẽ cho mô hình đủ lên xuống, nhấn nhá và nhịp điệu để học.

Một mẫu giọng ổn

“Cuối tuần rồi mình cuối cùng cũng sửa xong chiếc xe đạp cũ trong nhà kho. Sên rỉ cứng ngắc, mình ngâm dầu cả đêm — thật lòng là không nghĩ nó sẽ được. Vậy mà sáng hôm sau nó quay êm như mới, và mình đạp một mạch ra tận bờ sông.”

  • Nói với mức năng lượng bạn muốn giọng nhân bản có. Muốn giọng dẫn sôi nổi thì hãy sôi nổi hơn bình thường một chút.
  • Có một câu hỏi và một câu cảm thán để mô hình nghe được biên độ giọng của bạn.
  • Tránh ngắt quãng dài. Hai mươi giây nói liền mạch tốt hơn ba mươi giây có nhiều khoảng lặng.
  • Giữ một ngôn ngữ trong suốt mẫu giọng.

Câu đồng ý không phải thủ tục để đọc vội. Nó phải khớp từng chữ với văn bản hiển thị và phải cùng giọng với mẫu. Hãy đọc với tốc độ bình thường, trong cùng phòng, cùng micro và cùng khoảng cách. Nếu hệ thống từ chối, nguyên nhân thường là sót chữ, tiếng ồn nền hoặc người đọc khác.

Lỗi thường gặp và cách tránh

  1. Cắt đoạn từ video hay podcast. Nhạc nền, tiếng phòng và nén âm sẽ lọt vào giọng nhân bản. Hãy ghi mới.
  2. Ghi giọng người khác. Bạn chỉ được nhân bản giọng mình, hoặc giọng người đã đồng ý và tự ghi câu đồng ý.
  3. Thì thầm hoặc hét. Giọng ở thái cực không khái quát tốt; giọng nói bình thường cho bản nhân bản dễ dùng nhất.
  4. Vỡ tiếng. Nếu dạng sóng chạm đỉnh, phần đó bị méo. Giảm mức thu hoặc lùi ra xa một chút.

Sau khi giọng đã sẵn sàng

Giọng mới xuất hiện trong mục “Giọng của tôi” ở Text to Speech, SRT thành audio và nhiều người nói. Hãy thử với một đoạn ngắn trước khi dùng cho dự án dài. Giọng Gemini còn hiểu thẻ cảm xúc như <excited> hay <calm> ở đầu câu — cách nhanh nhất để thêm sắc thái mà không phải ghi lại. Nếu chưa ưng, hãy xoá giọng — slot được trả lại ngay — và ghi lại với những gì bạn vừa rút ra.

Giọng hoàn chỉnh được lưu tối đa một năm và tính theo mức credit Gemini thông thường khi tạo giọng nói. Bản ghi âm gốc không được giữ lại sau khi giọng được tạo.

Sẵn sàng ghi âm?

Công cụ nhân bản hướng dẫn bạn qua cả hai bản ghi và kiểm tra trước khi tạo giọng.

← Tất cả bài hướng dẫn