Công nghệ bảo mật giọng nói đã xuất hiện
Đại học Sungkyunkwan, Hàn Quốc cho biết, một nhóm nghiên cứu tại trường đã phát triển công nghệ bảo mật giọng nói nhằm đối phó với các hành vi phạm tội sử dụng công nghệ deepfake giọng nói, đang ngày càng tinh vi.
Nhóm nghiên cứu do GS Park Eun-il (Khoa Trí tuệ Nhân tạo Ứng dụng) dẫn đầu, đã chứng minh rằng, công nghệ này có khả năng phát hiện các đoạn âm thanh đã qua chỉnh sửa, được chèn vào các bản ghi âm giọng nói gốc.
Công nghệ này được kỳ vọng sẽ có phạm vi ứng dụng rộng rãi trong các lĩnh vực liên quan đến an ninh đời sống, bao gồm ngăn chặn lừa đảo qua giọng nói, xác thực danh tính bằng giọng nói cho các dịch vụ tài chính và phân tích bằng chứng kỹ thuật số.
Nhóm nghiên cứu đã sử dụng trí tuệ nhân tạo (AI) để phân tích những thay đổi tinh vi trong tín hiệu âm thanh và các đặc điểm lời nói mà tai người khó có thể nhận biết, qua đó, xác định chính xác vị trí của các đoạn lời nói đã bị chỉnh sửa với độ chính xác trong phạm vi một giây.
Hai bài nghiên cứu của nhóm đã được chấp nhận trình bày tại Interspeech 2026 – Hội nghị thường niên về khoa học và công nghệ lời nói, do Hiệp hội Truyền thông Lời nói Quốc tế (ISCA) tổ chức, dự kiến diễn ra từ ngày 27/9 đến ngày 1/10, tại Sydney, Úc.
GS Park, người đứng đầu nhóm nghiên cứu cho biết: "Những nỗ lực của chúng tôi trong việc phát triển các công nghệ mà mọi người có thể sử dụng một cách an toàn và hiệu quả, thay vì chỉ tập trung vào việc cải thiện hiệu suất AI đã được công nhận trên toàn cầu. Chúng tôi sẽ tiếp tục phát triển các công nghệ AI thế hệ mới có khả năng tăng cường sự an toàn cho xã hội và giải quyết các vấn đề thực tiễn".
Kết quả nghiên cứu được kỳ vọng sẽ tạo ra cơ sở quan trọng cho việc phát triển các hệ thống AI đáng tin cậy, cung cấp những giải thích thực sự hữu ích, thay vì chỉ mang tính thu hút bề ngoài, đặc biệt là trong các lĩnh vực đòi hỏi sự chính xác cao như y tế và tài chính.

Nhóm nghiên cứu cũng nêu bật nhiều công trình nghiên cứu đa dạng về sự hội tụ công nghệ AI trong đời sống thường ngày, bao gồm công nghệ tổng hợp giọng nói có khả năng tái tạo tự nhiên các phương ngữ và ngữ điệu vùng miền, chỉ dựa trên hình ảnh và thông tin địa điểm. Các nghiên cứu này bao gồm công nghệ phát hiện lời nói ác ý theo thời gian thực, chỉ dựa vào âm sắc và nhịp điệu giọng nói. Mô hình thị giác máy tính có khả năng nhận diện các tín hiệu cảm xúc tinh tế trong hình ảnh và công nghệ chẩn đoán hình ảnh y tế, giúp xác định chính xác vùng bệnh từ nguồn thông tin hạn chế. Những nghiên cứu này cho thấy phạm vi rộng lớn trong các hoạt động nghiên cứu hội tụ AI của nhóm, nhằm giải quyết các thách thức thực tiễn.

