キーボードを愛する私でさえ『音声入力』からは逃げられない

キーボードにも、テキストエディターにもこだわってきた。そんな私が、音声入力に屈した。

少なくとも今のAI環境では、音声をメインにやりとりした方が確実にコスパもいい。2026年の夏、そう思い始めて急速に切り替えた。いくつもの客観的かつ絶対的なメリットが出てきて、それに屈服したのだ。そして今は、音声で結構楽しくやっている。

こじらせていた10年

音声入力そのものは、ずいぶん前からあった。記憶の限りでは10年以上前、2015年くらいの段階で、スマホの音声入力をかなり活用している会社の同僚がいた。雑談の中で「スマホは音声入力の方が速くて楽だよ」と言われたくらいの、本当に軽い触れ込みだった。人によっては、10年以上前からすでにその良さを分かっていたのである。

ただ私は、ご存知の通りキーボードにかなりこだわりがあるし、NeovimやObsidianにもこだわってきた。「文字として打って、それを記録してこそだ」というのが、その時からすでにあった。それを結構こじらせて、2025年ぐらいまでは音声入力を全然積極的に取り入れてこなかった。もっと言うと、2026年の春の段階でも、まだ全然使っていなかったと思う。

仕事でも使ってこなかった。会社の自席でブツブツ言うわけにもいかない。ミーティングで音声入力をするのも、当時はかなり異質に感じられただろう。「あれ、録音してるんですか」みたいな感じになる。わざわざ対面でミーティングしているのに、録音して文字起こしをするというのは、自分もそうだったし、周りの人としても受け付けないんじゃないか。そういう実情はあったと思う。

時代の流れ

AIが話したことを整えてくれる

言わずもがなだが、7月以降のAIの発展がある。FableやAstraあたりが出てきて、世界が変わった。

思ったことを何でも喋れるのは楽だ。ただ、AIがなかった時代は、喋ったことを結局整理しなければいけなかった。誤字脱字の修正も含めて、これがめちゃくちゃ面倒くさかった。

AIの時代は、そもそも書いてあることが間違っていても推論で埋めてくれる。言葉として発したことを文字に変換する過程で多少ミスがあっても、もっと言うと音声がちゃんと入っていなくても、途切れていても、LLMが推論でかなり正確に、しかもコンテキストが入った状態で埋めてくれる。これで実用的になったのはめちゃくちゃでかい。

入力スピードだけでなく、整って出てくるまでのスピードでも、完全にキーボードよりも音声の方が上になった。

ホワイトボードの前でミネルヴァが説明している図。AI以前は「喋る、文字起こし、自分の手で整理」で整理がめちゃくちゃ面倒だった。今は「喋る、文字起こし、LLMが推論で補う」で整った文章が出てくる

仕事が自然言語のやり取りになった

AIがない時代はプログラミングをしなければいけなかったので、コーディングを声でやるのは、結構慣れないと難しかった。今は、要件や動作確認の結果、方針のやり取りを自然言語でするだけで仕事ができるようになった。なおさら音声入力のメリットが増している。

録音が市民権を得た

仕事では、Google Meetで会話すると、終わった後にGeminiがGoogleドキュメントの議事録を作ってくれるやつ。あれがかなり市民権を得て、みんな使うようになってきた。それで、会議中の録音のハードルは一気に下がった。

Macの音声入力がどこでも使える

私がMacに変えたのは、ちょうど2025年の5月くらいだ。Macの音声入力は結構レベルが高い。通常の入力として、音声入力がショートカットキー一発で使える。ツールが音声入力に対応している・していないはどうでもよくて、やろうと思えばどこでも音声入力ができる状態だった。

背中を押したもの

AI仙人さんのYouTube

一番大きかったのは、AI仙人さんのYouTubeチャンネルだ。春から夏あたりにかけて定期的に見るようになり、そこでAI仙人さんが毎回のように「音声入力いいよ」と推してこられる。

初めは「なんでも音声か」みたいな感じで聞いていた。でも何回も何回も言われると、ちょっと気になってくる。実際に動画では音声入力をして、かなりスムーズにやり取りをされている。定期的に音声入力を推していただいたことで、じゃあ自分もやろうかなと、かなり素直に入れるようになった。

AI仙人さんのチャンネルは、実業務をしている人間としても、クリエイティブなことをやっている人間としても、内容を信頼している。勝手ながら、非常にお世話になったし、今もお世話になっている。

参考に、AI仙人さんが音声入力を推している動画をいくつか紹介しておく。

一人では会議が回らなかった

ミーティングは、どうしても声じゃないともう厳しい。タイピングしたり文字を読んだりでは、どうしても追いつかない。基本は、図でAIに現状を可視化してもらいつつ、声で記録してもらった後で文字で整理する。そうならざるを得ないと思う。

これにはもうひとつ背景がある。今進めている仕事のプロジェクトは、開発が私一人なのだ。ミーティングの準備、ファシリテーション、議論への参加、議事録の記録、ミーティング後の議事録の清書と展開、ドキュメントへの反映、連絡などを、私一人で行わなければいけない。特にミーティング中に、ファシリテーションと書記と議論を全部同時にやるのは無理だった。

みみぞうが一人で、マイク・ペン・ノート・資料の束を抱え、紙が舞うなかで目を回して混乱している

それを解決せざるを得なかったから、KIKIGAKIを作った。逆に、もしそういう仕事をやっていなかったら、KIKIGAKIはできていなかったかもしれないし、音声入力にチャレンジしていなかった可能性もある。

すぐには慣れなかった

夏に切り替えたとはいえ、音声入力にして2、3日ですぐできるようになったわけではない。AI仙人さんもおっしゃっていたが、音声入力が実用レベルでできるようになるには、かなりの慣れが必要だ。そのために、常日頃からAIとは音声でやりとりする癖をつける。AIと融合する、というやつだ。

これをかなり意識してやった。キーボードであれば数秒で済むようなことでも、あえて音声でやりとりしてみる。家でもかなりやった。

KIKIGAKIを開発していた手前、実際に私自身が喋って、それがどう反映されるのかをテストしたり、ドッグフーディングをしたりしなければいけなかった。その過程で、音声入力に対する違和感が以前よりなくなり、AIとのやりとりを音声でするのに慣れた、というのも正直あると思う。

仕事のミーティングでも変わった。今までは、人間がなんとなく議事録を考えながら取ってくれていた。そこまで完全に取らなくても、当人たちが理解していればいいかな、という風潮もあったと思う。でも、今やっているAIベースのコンテキストドキュメンテーションでは、ミーティング中に声として出して、それがAIにインプットされないと、なかったことになる。

だから喋る時に、これは情報として価値があるものなのか、語弊なく伝わるものなのか、この音声のボリュームと話すスピードでしっかり記録されるのか、をかなり気にするようになった。

ただ逆に、それを気にしすぎると、今度は肝心のミーティングの話題の方に集中できない。例えるなら、

  • タッチタイピングに慣れていなければ、タイピングに意識が行って、今やっている仕事に集中できない
  • エディターやIDEの操作に慣れていなければ、コーディングをしていても、ショートカットキーや操作自体に意識が行って、広い視野で集中してソースコードを眺めることができない

といった具合に、考える方に脳のリソースを割けていない状態だ。それと同じことが、音声入力に慣れないうちはあると思う。

ホワイトボードの前でオブシディアが説明している図。ミーティング中の脳のリソースは、慣れないうちは話し方への意識が大半を占め、慣れてくるとミーティングの話題が大半になる

今でももちろん、話す内容には気を使う。でも、どれくらいなら誤字脱字が入ったり正確な表現をしなかったりしても、AIがコンテキストや意図を汲み取って正しく情報としてインプットしてくれるのかが、だんだんわかってくる。わかってくれば、話し方の正解にも近づける。ある程度話し方のフォーメーションが固まってくれば、Neovimを思考の速度で操作するのと一緒で、そこまで考えなくてもAIにとって有意義なインプットとなる話し方ができるようになる。その実感がある。

ただ、この話をしている今も、結構意識して喋っている状態だ。本当に空気を吸うように喋れるようになるには、今年いっぱい、あと3か月くらいかかるかなと思っている。音声が今後の主戦場になるのはほぼ決まったと思っているので、先の長い投資だと思って、焦らずゆっくり慣れていこうと思う。

屈してみてわかったこと

思い浮かんだらすぐ喋れる

プライベートの個人開発で音声入力を取り入れた一番のモチベは、キーボードで打つよりも音声の方が楽だということだ。

よく言われていることだが、人間のトップスピードとしては、なんだかんだ言ってキーボードの入力よりも音声の方が速い。速いのは単純な入力速度だけではない。頭にパッと思い浮かんだものを、音声ならすぐ喋れる。キーボードで文字を入力しようとすると、どうしてもワンクッション置かなければいけない。

地味に大変なのが、日本語なのでIMEの変換だ。あれが割とバカにならない。英語圏の人ならああいう変換がいらないので、本当に思考の速度で入力できるかもしれない。IMEはどうしても変換結果に左右されるので、リズムが勝てないというのは直感としてあった。まあ、それを言ったら音声入力の方も、変換のない英語の方が圧倒的に有利なのだけど。

読む量とのバランス

文字を読むことがどうしても増えた。文字を読むのに対して、文字をタイピングするのを繰り返しているだけだと、気持ち的に結構辛い。読む方はしょうがないとして、返す方は別に文字じゃなくてもいい。音声の方がバランスがいいんじゃないか、というのもあるのかもしれない。

指と喉の冗長化

キーボードで文字を入力するのを、今までずっとやってきた。これは結構リスキーだ。例えば指。一番ありきたりなところだと腱鞘炎。職業病とは関係なく、突き指や、手のちょっとした怪我もある。血管の調子があまり良くなくて、指の動きが悪いこともある。指が動かなくなった瞬間に、かなり生産性が下がるのだ。

そういう時に、音声入力という第二の道を持っておくと、指でも喉でも、どちらかの調子が悪くても、もう片方の入力方式でやりたいことができる。この冗長化はめちゃくちゃ重要だと個人的には思っている。

ホワイトボードの前でミネルヴァが説明している図。指のキーボードと喉の音声入力の2本の道がAIへつながり、指の道が途切れても喉の道で届く

弱点は、喉が枯れやすくなること。ただ、そこはタイピングで腱鞘炎になるのと表裏一体だ。その時々で、指なのか喉なのか、調子がいい方の入力方法と、スピードや品質の違いを使い分けてやっていくのがいいと思う。

副次的な効果

個人開発でも喋ることが増えると、人間、黙っているよりも話している方が案外健康的だ。音声に正しくいい感じに入力してほしいので、論理立てて話す練習や、認識してもらいやすいはっきりした喋り方の練習にもなる。改善するかはさておき。タイピングしているより、腹から声を出している方が地味に運動にもなる。

今の使い分け

会議と長い壁打ちはKIKIGAKI

KIKIGAKIは、nocturneでもすでに紹介しているMacのツールだ。

https://github.com/tadashi-aikawa/kikigaki

ミーティングを録音して、リアルタイムで文字起こしと話者判別を行いつつ、AIエージェントと連携して議事録やボード(今の会議の状況の可視化)を作る。さらに最終的には清書させたりもできる。

NVIDIAのNemotronというモデルが出てきてからは安定して、6人くらいだったらほぼ確実な精度で記録できるようになった。通常のミーティングであれば、大体問題なくコンテキストを集められている。

この記事のたたき台を作っている時も、KIKIGAKIを使っている。parliamentなどでの通常の音声入力だと、話している内容をすべて拾うのは結構難しい。ふとした瞬間にフォーカスが外れたら音声入力が止まってしまうこともあれば、急に全然入力が入らなくなることもある。こうやって長時間話したり、壁打ちをしてAIとたたき台を作りつつ整理していくところでは、一人でもKIKIGAKIを使った方が便利だ。

KIKIGAKIは、1か月ぐらい家でも会社でもドッグフーディングをして改善してきて、かなり骨格が固まってきた。10月の後半くらいを目標に、バージョン1.0.0を出す予定だ。

開発の指示はMacの音声入力とparliament

普通に開発をやる時は、AIとやり取りするparliamentを立ち上げて、どんどん入力して指示を出していく。そこは、マイクの音声をMacの音声入力で文字起こしして入れて、エンターで送信している。だらだら話すことはそんなにないので。

ターミナルメインじゃなくて、parliamentメインになったというのも、ひとつ大きいかもしれない。

今もキーボードは打つ

もちろん、キーボードは今も打つ。会社の自席で仕事をしている時は、さすがにブツブツ言えないので、キーボードで仕事をしている。あとはターミナルの操作とか、そういう系だ。AIを通さない操作はLLMの補正が入らないので、キーボードの方がやっぱり楽だ。

Neovimももちろん使っている。ただ、コーディングはもう最近全くしない。一番多いのは、設定ファイルやMDファイルの確認と変更だと思う。ターミナルも、Gitのpushをする時や、ちょっとログを見たい時には使っている。

ホワイトボードの前でオブシディアが説明している図。会議と長い壁打ちはKIKIGAKI、開発の指示はMacの音声入力とparliament、自席とターミナルはキーボード

これからはマイクが肝

音声入力は、これからどんどんホットになっていく。そこで地味に肝になってくるのが、音声入力の環境だ。マイクがちゃんと拾えるか。できるだけ言葉が綺麗に入るか。AIが補正してくれるとはいえ、いいに越したことはない。

コロナでリモートミーティングが多発していた5年前、私の中ではある意味最大のオーディオブームが来ていた。当時はオンラインミーティングの環境を良くしましょうという話があって、マイク・スピーカー・イヤホンなどを、皆さんかなりこだわって揃えられていたと思う。音声入力が重要になった時代では、その中のマイクが再びすごく大事になってきた。

私もその時、スピーカーホンを2つぐらい買って試した。そのうちの良い方の1個は、今、会社の広いミーティングスペースで録音する時に有効活用できている。邪魔だったので捨てようと思ったことが何度もあったけれど、5年以上キープしておいてよかった。何がどこで役に立つかわからない、というのは世の常だろうか。

案外、悪くない

以前は、仕事でもプライベートでも使っているHHKB Studioをカタカタコトコトさせて、ターミナル上でいろんなことをやるのが快感だった。むしろそっちがメインの目的じゃないかというくらいだ。だから、それがなくなると結構辛いかなと思っていた。

https://happyhackingkb.com/jp/products/studio/

でも案外、文字の入力なしに音声でひたすらやり取りするのも、これはこれである種の全能感みたいなものがあって悪くない。キーボードをカタカタ打たなくても、マイクに向けてひたすら喋って物事が進むのも、悪くないのだ。

夜の森のカフェで、男性がマイクに向かって話しながら開発を進めている後ろ姿。そばでネオちゃんが楽しそうに画面をのぞき込んでいる