Necklace

基于模型的语音分析

项目简介

Necklace(项链),是一个基于开源模型然后微调的语音性别分析工具。目前还在非常初期的阶段,识别效果不稳定,可能非常不准,即使非常 pass 的声音也可能获得迥异的分析结果,所以结果仅供参考。

希望这个工具像项链一样,能够让本就出色的你,变得更加熠熠生辉。

你,值得被听见。

分析原理与数据处理流程

模型

  • 基础模型:wav2vec2-large-xlsr-53-gender-recognition(LibriSpeech 预训练)
  • 微调数据:Mozilla Common Voice zh-CN 语料(33,370 条训练样本)
  • 任务:二分类(male / female),输出 female 概率

音频处理流程

  • 前端录制 → Web Audio API 重采样为 16kHz 单声道 WAV
  • 后端 librosa 加载 → 16kHz float32 numpy 数组
  • 截断至 10 秒 / 不足 1 秒补零(与训练一致)
  • Wav2Vec2FeatureExtractor 归一化(零均值单位方差)

如何解读结果

  • 概率 > 0.5:偏向女性声音特征
  • 建议录制 3-10 秒清晰语音,太短或不清晰可能不稳定
  • 模型评估 test 集 ROC-AUC = 0.991
点击开始录音
建议录制 3-10 秒清晰语音,例如从一数到十
录音完成,请回放确认
点击或拖拽音频文件到此处
支持 wav / mp3 / webm 格式
分析中...
女性化概率
0%