마침내 AI 전사 도구를 안정적으로 사용하고 사용 가능한 전사본을 얻을 수 있는 단계에 이르렀지만, 결론은 현재 우리가 너무 많다는 것입니다. 정보가 너무 많기 때문에 정보가 어떻게 사용되는지 알지 못한 채 회사에 정보를 제공할 가능성이 더 높습니다. 저는 개인적으로 Otter 및 Fireflies와 같은 신흥 AI 스타트업이 내 데이터를 안전하게 유지하는 것을 신뢰하지 않습니다. 특히 이러한 만남이 내 데이터뿐만 아니라 내 고객과도 관련될 때 더욱 그렇습니다.
저는 이러한 도구 사용을 중단하고 Whisper OpenAI로 회의를 녹음하기 시작했습니다. 이는 장치에서 전사를 처리하는 오픈 소스 도구이며 MacBook과 같은 장치에서 원활하게 실행할 수 있을 만큼 가볍습니다. 최근에 2시간 동안 녹음했는데 4분도 채 안 되어 깨끗한 녹취록이 만들어졌습니다. 문제는 자체 호스팅 도구를 사용하여 편의성이나 개인 정보 보호를 희생하지 않는다는 것입니다.
무료이고 기기에 내장되어 있기 때문에
Whisper는 오픈 소스 OpenAI 음성 인식 모델이며 컴퓨터에 직접 설치하여 오디오 녹음을 텍스트로 변환할 수 있습니다. 다국어 전사를 지원하고 음성 언어를 감지하며 여러 언어의 음성을 영어로 번역할 수 있습니다. OpenAI는 MIT 라이선스에 따라 코드와 모델 가중치를 모두 공개했으므로 OpenAI에 로그를 보내지 않고도 Whisper를 장치에서 완전히 실행할 수 있습니다.
Whisper는 가벼운 Tiny 모델부터 더 크고 강력한 Large 및 Turbo 모델까지 다양한 크기로 제공됩니다. 버전이 작을수록 메모리가 덜 필요하고 녹음 처리 속도가 더 빨라지는 반면, 버전이 클수록 더 정확한 기록을 생성하는 경향이 있습니다. MacBook과 같은 장치를 사용하면 쉽게 할 수 있으며 일단 모델을 다운로드하면 인터넷 연결 없이도 작동합니다. 또한 계정이나 API 키가 필요하지 않습니다.
제가 Whisper를 최고의 전사 도구라고 부르는 이유는 Whisper가 가장 정확한 전사본을 가능하게 하기 때문이 아닙니다. 내 경험에 따르면 ChatGPT 내의 클라우드 전사 및 받아쓰기 모델은 문자 추가, 이름 이해 및 어수선한 음성 정리에 더 좋습니다. Whisper는 녹음을 어디에도 업로드하지 않고도 여전히 깨끗하고 완전히 사용 가능한 녹취록을 제공합니다.
모델이 시스템에 로드되면 아무것도 필요하지 않습니다. 시중의 다른 서비스와 비교해보시면 그 가치를 느끼실 수 있을 것입니다. Otter.ai 및 Fireflies.ai와 같은 서비스는 사용할 수 있는 시간을 제한하며, 해당 제한을 초과하면 비용을 지불해야 합니다.
Plaud와 같은 전용 음성 녹음기를 사용할 수 있지만 이 경우에도 구독이 함께 제공됩니다. 녹음하지 않고도 계속해서 녹음할 수 있지만, 일정 한도를 초과하면 녹음 비용을 지불해야 합니다. 반면에 Whisper는 일단 설치되면 아무것도 필요하지 않습니다. GUI도 없습니다. 이는 터미널에서 실행되며 전사본이 포함된 .txt 파일을 제공합니다.
내 Whisper 설정은 기본적으로 드래그 앤 드롭입니다.
또한 GUI가 없습니다.
저는 Apple Silicon에 최적화된 경량 런타임인 Whisper.cpp를 통해 OpenAI Whisper를 실행하고 있습니다. 내 설정은 Whisper 모델, 전사 스크립트, 구성 스크립트 및 macOS 명령 파일이 포함된 폴더 안에 있습니다. 모델을 다운로드한 후 전체 전사 프로세스가 오프라인으로 진행됩니다.
일상적인 사용을 위해 Transcribe Meeting.command 파일을 두 번 클릭하고 처리하려는 녹음을 선택합니다. Finder에서 하나 이상의 항목을 명령 파일로 드래그할 수도 있습니다. 스크립트는 입력 처리에 FFmpeg를 사용하므로 M4A, MP3, MP4, MOV, WAV, FLAC, OGG 및 WebM을 포함한 일반적인 오디오 및 비디오 형식에서 작동합니다.
녹음을 처리한 후 Whisper는 원본 파일 옆에 녹음 내용 폴더를 만듭니다. 읽을 수 있는 대본을 타임스탬프가 표시된 .srt 및 .vtt 자막 파일과 함께 .txt 파일로 저장합니다. 또한 구조화된 전사 데이터가 포함된 .json 파일을 생성합니다.
더 많은 제어가 필요한 경우 터미널을 통해 동일한 작업 흐름을 수행할 수 있습니다.
./transcribe ~/Downloads/team-meeting.mp4
./transcribe --language en ~/Downloads/team-meeting.m4a
./transcribe --translate ~/Downloads/spanish-meeting.mp3
Whisper는 음성 언어를 자동으로 감지하지만 회의가 어떤 언어로 진행되는지 이미 알고 있는 경우 –언어를 지정하면 정확성이 향상될 수 있습니다. –translate 옵션을 사용하면 영어가 아닌 음성을 영어로 변환하는 반면 –output-dir을 사용하면 녹음 내용이 포함된 폴더가 아닌 다른 위치에 기록을 저장할 수 있습니다. 속도, 메모리 사용량 및 정확성 간의 균형을 변경하려는 경우 WHISPER_MODEL 환경 변수를 통해 스크립트가 다른 GGML 모델을 가리키도록 할 수도 있습니다.
2시간 동안 진행된 회의는 4분도 채 걸리지 않았습니다.
그리고 그 성적표는 유용했어요
나는 최근에 내 고객 중 한 명과 2시간 동안의 미팅을 녹음한 것을 속삭였습니다. 브랜드의 콘텐츠 전략과 우리가 할 수 있는 다양한 마케팅 활동에 대해 논의하는 통화 시간을 보냈기 때문에 전사를 위해 특별히 제작된 짧은 음성 녹음이라기보다는 제대로 된 주고받는 대화였습니다. Whisper는 내 MacBook에서 로컬로 전체 파일을 처리하고 4분도 채 안 되어 녹취록을 작성했습니다.
대본도 매우 정확했습니다. 모든 문장을 완벽한 영어로 변환했다고는 말할 수 없지만 결과는 깨끗하고 사용 가능했습니다. 특히 긴 녹음을 얼마나 빨리 처리하는지 고려하면 이는 내 노트북에서 완벽하게 작동하는 모델에 대한 좋은 결과입니다.
저는 회의를 녹음하고 기록하는 여러 도구를 사용해 왔으며 최근 이 목적을 위해 특별히 제작된 특수 AI 녹음기를 테스트했습니다. 그 장치조차도 Whisper에서 얻은 것만큼 좋은 성적표를 생성하지 못했습니다.