新規のご相談を受付中(法人・個人どちらでも)

GPUカーネルから
配信まで、リアルタイム
まるごとつくる。

「間に合わせる」ことが要求される層を担当しています。CUDA / WebGPU のカーネル、プロセス単位の音声キャプチャ、リアルタイム音声変換、アバターの描画、そしてそれを画面に出す WebRTC の経路まで。その上に乗るプロダクトも、同じ手でつくります。

エンジニアリングは m96-chan(原田侑亮)。有限会社DEVenus(東京・新宿)代表取締役です。法人契約・請求は会社として対応し、単発の技術相談は個人として気軽にお受けしています。

◆ 主軸

民生GPU 1枚で動く、リアルタイムVTuber

立ち絵1枚を入れると、しゃべって、呼吸して、まばたきするプレゼンターが出てくる。全部ローカルで動いて、そのままOBSに流せます。

立ち絵1枚Live2Dのリギングも多層PSDも不要
蒸留したポーズモデルキャラごとのstudentモデルで、デスクトップGPUでリアルタイム
声はTTSでも、自分のマイクでもブラウザTTS、またはRust製の音声変換を仮想マイクへ
リップシンクと待機モーション口は波形から復元。しゃべっていない間もまばたきと呼吸は止まらない
OBSへ出力クリーン出力・透過レイアウトでクロマキーも可
約25fps蒸留後のリアルタイム経路
完全ローカルクラウドもAPIキーも不要
106分連続読み上げでも増えない
リアルタイムアバター基盤

3つのレイヤー、全部自分で書いて、全部OSSにしています

世に出ている「AI VTuber」のデモの多くは、クラウドAPIに顔をつけたものです。これは目の前のマシンだけで動きます。モデルの移植から仮想マイク、配信の載せ替えまで、全レイヤーを自分で持っているからです。

顔と存在感

VPresentation ↗

正面向きの立ち絵1枚から、PDFのスライドを1ページずつ読み上げるプレゼンターを生成します。Talking Head Anime 4 を Rust + candle に移植(CUDA / Metal / CPU を同一コードベースで)、リアルタイム経路にはキャラごとの蒸留studentモデルを使います。

約25fps蒸留student、キャラ単位
約13時間RTX 5090 での蒸留1回あたり
上限あり106分の連続読み上げでもメモリが伸びない設計

babiniku.rs ↗

Pure Rust のリアルタイムゼロショット音声変換。数秒の参照音声を渡すだけで、仮想マイクがキャラクターの声を Discord / Zoom / OBS に届けます。5つのエンジンを1つのインターフェースの裏に置き、実行時にPythonもCUDA Toolkitも要りません。

RTF 0.14ふつうのCPUでend-to-end(MeanVC)
約0.16秒GPUで320msブロックあたり(Vevo-Timbre)
端末内完結自分の声がマシンの外に出ない
伝送とキャプチャ

OBS-WebRTC-Link ↗

OBS Studio に汎用のWebRTC入出力を足すC++プラグイン。低レイテンシの双方向の映像・音声を、シーングラフに直接出し入れできます。特定アプリの音だけを拾いたいときは ProcTap と組み合わせます。

双方向OBSに対してWebRTCのin/out両方
★11GitHub
C++ネイティブプラグイン、中継プロセスなし

正直な現状:ブラウザアプリは今日の時点で「動いて・しゃべって・資料を読む」ところまで来ていて、キャラクターは3体分の蒸留が済んでいます。スライドのトランジションとマイク入力によるリップシンクはまだ実装中で、それも公開したまま進めています。
この形のシステム(プレゼンター、受付、コンパニオン、顔のあるサポートエージェントなど)をプロダクトとして必要とされている場合、難しい部分はすでに解けていて、あとは統合が仕事になります。

できること

何を頼めるのか

繰り返し担当している4つの領域です。それぞれ、実際に動いているコードが裏にあります。ご相談が2つの領域のあいだに落ちている場合、たいていそこが一番役に立てる場所です。

01

リアルタイムAIアバター / VTuber基盤

キャラクターの動き、声、リップシンク、レイアウト、そして配信やアプリへの載せ方まで一気通貫で。プライバシーやコストの都合でクラウド往復が使えない場合は、ローカル前提で設計します。

  • 立ち絵1枚からの2Dキャラクターアニメーション
  • ゼロショット音声変換・TTS と仮想マイクの実装
  • OBS / 仮想カメラ / WebRTC への出力
  • お客様のハードウェアでフレーム予算に収めるための蒸留とチューニング

実績 VPresentation · babiniku.rs · voxshot

02

GPU・LLM推論の低レイヤー最適化

「ベンチマーク上は十分速いのに、本番だと遅い」を扱います。データセンター向けのカードからブラウザのタブ、スマートフォンまで、実際に載せる先のアーキテクチャに合わせてカーネルから手を入れます。

  • Ampere(SM86)〜 Blackwell(SM120)向けCUDAカーネル
  • ブラウザ内推論のための WebGPU / WGSL コンピュート
  • 量子化・三値(1.58bit)推論パスの実装
  • オンデバイス / エッジNPUへの展開

実績 PyGPUkit · 0xBitNet · NxPU

03

低レイテンシ音声・映像パイプライン

キャプチャ・推論・再生を100ms以下の同じ予算に収める必要があるシステム。この領域の面白い不具合は、たいていモデルではなくOS側にあります。

  • プロセス単位の音声キャプチャ(WASAPI process loopback)
  • リアルタイムSTT / TTS パイプラインとGPUエンコーディング
  • WebRTC・配信アーキテクチャの設計
  • Windows内部:ETWトレース、ネイティブプラグイン、Rust/C++コア+Pythonバインディング

実績 ProcTap · PyETWkit · MeetScribe

04

技術顧問・アーキテクチャ / AI駆動開発の導入

アーキテクチャレビュー、技術選定、そして「入れただけ」で終わらないAI駆動開発の定着まで。CTO・技術リードを含む15年分の現場経験をもとにお話しします。

  • アーキテクチャレビューと技術選定(ビジネス側の都合込みで)
  • 実際のチームで運用に耐えるAgent型開発フローの設計
  • 開発組織・プロセスの設計、新人/中堅の育成体制づくり
  • エンジニア向けだけでなく、経営層向けの提案書・プレゼンまで

背景 雇われCTO経験 · ベンダー4社統合の技術リード · オフショア(インド/ベトナム)のベンダーコントロール

相談のはじめ方

入口は4つあります

近いものを選んでいただければ十分です。スコープ・期間・金額は最初の会話から決めていきます。入力フォームもありませんし、「この規模でないと受けない」という下限もありません。

💬

スポット技術相談

難しい問いを1つ、1回の打ち合わせで。「これ40msに収まりますか」「GPUの選定はこれで合ってますか」「なぜブラウザでだけカクつくのか」など。

🔬

PoC・実現可能性の検証

短期・範囲を区切った実装で、「御社のハードと予算で成立するのか」に答えを出します。所感ではなく、数字で。

🛠️

受託開発

システムそのもの、あるいはその中の一番難しい層を、御社のチームと並走してつくります。納品物は御社のものになるコードと、判断の経緯を残したドキュメント。

🧭

技術顧問

継続的な関与として。アーキテクチャレビュー、技術判断、そしてスプリント単位ではなく月単位でチームの地力を上げること。

最初のメールに書くこと

仕様書は要りません。4行あれば、自分が適任かどうかをお伝えできます。適任でない場合はそう言いますし、心当たりがあれば別の方をご紹介します。

  1. 何をつくろうとしているかと、だいたいいつまでに必要か。
  2. どこが痛いか — 届いていないレイテンシ・フレームレート・コスト・品質の数字。
  3. 動かせないもの — ハード、OS、プラットフォーム、既存コードなど前提として固定されているもの。
  4. 上の4つのどれに近いか(お分かりであれば。当たっていなくても構いません)
つくったもの

OSSとして公開し、ベンチマークも出しています

すべて自分で書いて、自分でメンテナンスしているライブラリ/ツールです。いくつかはパッケージレジストリに公開済みで、いくつかはブラウザですぐ触れるデモがあります。

0xBitNet

★ 23

Microsoft の BitNet b1.58 三値LLMを WebGPU で動かします。WGSLの自作カーネルで、WASMもサーバーも使いません。npm / crates.io / PyPI / Maven Central に公開し、TypeScript・Rust・Python・Swift・Java・C のバインディングを提供しています。

ProcTap

★ 18

WASAPI process loopback を使って、PID指定で特定プロセスの音だけを録るライブラリ。「通話は入れずにゲームの音だけ録る」がPythonの2行で書けるようになります。PyPI公開済み。

PythonWASAPIAudio

arXiv・Hugging Face・GitHub から、AI/MLの論文・モデル・リポジトリ・トレンドを毎時収集して定点観測するダッシュボード。自分用の観測所をそのまま公開しています。

Astro自動収集 サイト ↗

PyGPUkit

★ 3

Python向けの最小GPUランタイム。手書きCUDAカーネル、明示的なメモリ管理、そして重いフレームワークを下に敷かないLLM推論。Ampere から Blackwell(RTX 5090 の SM120 含む)まで対応。

CUDAPythonC++

NxPU

★ 3

WGSL → NPU のトランスパイラ。WebGPUのシェーダー言語をNPUのネイティブ形式にコンパイルし、1つのシェーダーで実機のアクセラレータを狙えるようにします。バックエンドは Qualcomm / MediaTek / Samsung / Rockchip / ARM Ethos / CEVA / Intel / AMD / CoreML / ONNX / TFLite / StableHLO。

RustNPUコンパイラ APIドキュメント ↗

PyETWkit

★ 5

Python向けの高性能 ETW(Event Tracing for Windows)コンシューマー。コアはRustで書き、PyO3でバインドしています。自分でC++に降りなくても、ETW本来のスループットが出ます。

RustPyO3Windows

voxshot

★ 1

ブラウザ前提のゼロショットTTS・音声クローン(JavaScript / TypeScript向け)。WebGPU + ONNX Runtime Web で、Pythonもバックエンドも APIキーも不要。VPresentation の中で声を出しているのがこれです。

TypeScriptWebGPUTTS デモ ↗

KTApple

★ 6

macOS向けの KDE Plasma 風タイル型ウィンドウ管理。ビジュアルなタイルエディタ、Shift+Drop でのウィンドウ配置、ギャップのドラッグによるリサイズ。SIPの無効化は不要です。

SwiftmacOS 解説記事 ↗

DroidRunner

★ 1

余っているAndroid端末を GitHub Actions のセルフホストランナーにするツール。ARM64ビルドと実機NPUテストを、rootもTermuxもなしで回せます。

KotlinCI/CDNPU 製品ページ ↗
GitHubの全リポジトリ →
経歴

15年、だいたい「誰も開けたくない層」で仕事をしてきました

キャリアの最初はC++ / Win32 の Windows クライアントでした。給与ソフトの新規開発、インストーラー、そして「データ破損の問い合わせが、そのライブラリを書いた本人のところに来る」種類のコードベースです。その後はカプコンでゲームサーバー。稼働中のタイトルは、レイテンシと負荷が何なのかを容赦なく教えてくれる場所で、最終的にはサーバー運用のリードも担当しました。

そこからはCTO・技術リードとして、ベンダー4社の統合、開発組織づくり、インド・ベトナムのオフショアチーム運営など。2023年からは有限会社DEVenusの代表として、AI案件・3D案件を主軸に活動しています。

一貫しているのは縦方向のレンジです。CUDAカーネルも、その出力を映すReact Nativeのフロントも書けて、そのあいだのトレードオフをコードを書かない人にも説明できる。いまはそれが主にリアルタイムAIの音声・映像に向いていて、業務では SM120 / SM86 のカーネルでGPU推論を実装しつつ、夜はアバターモデルをRustに移植しています。

日本語・英語どちらでも仕事をします。経営層と話すことにも抵抗はありません。

よく使う技術

Rust Python C++ TypeScript CUDA / WGSL PyO3 WebGPU WASAPI / ETW WebRTC AWS / GCP / Azure FastAPI React / Next.js
  • 2023 – 現在
    有限会社DEVenus 代表取締役SI・DXコンサル。AI案件と3D案件が主軸。東京・新宿。
  • 2025 – 現在
    リアルタイムAIボイスチャット基盤の開発Rust/C++でのGPUカーネルとスケジューリング、SM120・SM86でのLLM推論、GPUエンコードからのリアルタイムSTT。
  • 2024
    東京AI祭 AI動画部門 銅賞aisai.tokyo
  • 2021 – 2023
    合同会社ENJOY CTOプロダクトアーキテクチャ、技術検証、プロダクト基盤の整備。
  • 2017 – 2021
    株式会社カプコン ゲームサーバーエンジニア/リード稼働タイトルのサーバー、AWSインフラ、運用リード。
  • 2010 – 2013
    弥生株式会社 WindowsクライアントエンジニアC++ / Win32 の給与ソフト、.NETへの載せ替え、インストーラー開発。
  • ORCID 0009-0007-5967-1182個人研究:オンデバイス推論、Qualcomm SoC向けNNカーネル。

つくろうとしているものの話を聞かせてください

ざっくりした構想の段階で大丈夫です。いただいたものには必ず返信します(だいたい1〜2日以内)。「たぶんご期待には沿えませんが」というお返事も含めて。

[email protected]

日本語・英語どちらでも。法人契約・ご請求は有限会社DEVenusとして対応します。NDAの締結も問題ありません。