OWN AI MODELS — 自社開発

見る・聞く・話す。
自社AIモデル nagi

神戸ソフトがアーキテクチャから一から開発している、画像認識と音声処理のAIモデルシリーズです。端末の中でリアルタイムに動くことを前提に、軽く・速く作っています。

nagi.vision

画像認識

1つのアーキテクチャで、分類・物体検出・回転矩形(OBB)・セグメンテーション・姿勢推定の5タスクに対応。既存の検出器のコードを使わず、一から実装しています。

nagi.vision

分類・検出・OBB・セグメンテーション・ポーズ

アンカーフリー・NMSフリーの軽量画像認識フレームワーク。

  • NMS(重複除去の後処理)が不要で、推論が速く組み込みやすい
  • n / s / m の3サイズ。最小の n は約220万パラメータ
  • ONNX 書き出しで、スマートフォンやエッジ機器にそのまま載せられる
5
対応タスク
2.2M
最小モデルのパラメータ数
NMS-free
後処理なしで推論

nagi.voice

音声処理

聞く(認識)・話す(発話)・澄ませる(ノイズ除去)。音声まわりを日本語前提で自社開発し、端末の中でリアルタイムに動くことを重視しています。

nagi.voice.denoise

ノイズ除去

声はそのまま、周囲の雑音だけを消すストリーミング型モデル。

  • 元の位相を使って復元するため、声質やイントネーションが変わらない
  • 因果的な設計で、20ms 単位のリアルタイム処理にも対応
  • ストリーミング ONNX に書き出し、NPU・DSP 搭載機器へ組み込める
詳細と音声サンプル
+11.4dB
SI-SDR改善(実録音サンプル)
約6.6ms
マイコンNPUでの1フレーム処理
3.0×
実時間より速い(16kHz版)

nagi.voice.speech

音声合成(発話)

アクセント対応の日本語音声合成(Text-to-Speech)。

  • 日本語のアクセントを考慮したフロントエンドで、自然な読み上げ
  • 録音データから新しい声を追加学習できる
  • 話速・声の高さを調整可能。24kHz で出力
24kHz
出力品質
日本語
アクセント対応
声を追加
録音から追加学習

nagi.voice.asr

音声認識

開発中

端末内で動く、日本語の音声認識モデル。

  • 大規模な日本語音声コーパスで学習を進めています
  • オンデバイス前提の軽量設計
  • NPU上での日本語音声認識(Whisper)の実装で得た知見を反映

仕様は公開準備中です。先行してのご相談・検証も承ります。

WHY OWN MODELS

なぜ、モデルから作るのか。

載せる機器に合わせられる

スマートフォン・組み込み機器・マイコンのNPUなど、搭載先の処理性能と消費電力に合わせてモデルの大きさを作り変えます。

日本語を前提に作る

音声の認識・合成は、日本語のデータとアクセントを前提に設計。海外製モデルで起きがちな読み間違いを減らします。

中身まで説明できる

アーキテクチャから自社で実装しているため、構造・学習データ・提供条件まで含めて、製品への組み込みを一緒に設計できます。

FOR BUSINESS

御社の製品に、nagi を。

nagi は商用でご提供しています。用途・搭載先・提供形態に合わせて、ライセンス条件も含めてご相談ください。

御社データでの追加学習

現場の画像・音声で追加学習し、用途に特化した専用モデルとしてご提供します。

NPU・エッジ実装

量子化・NPU向け変換・ファームウェアへの組み込みまで。クラウドに頼らず端末で動かします。

システムへの組み込み

既存システム・アプリへの組み込み、API化、推論基盤の構築まで一貫して対応します。

無料相談