01 — Cases
4つの自動化と、運用の数字
流れは左から右へ(スマートフォンでは上から下へ)。数字の下の日付は、その数字を測った日です。
- 01 / 動画研修・会議の録画をノートに45分24秒の動画を41秒で処理
- 02 / 仕入れ中古品の新着を一次選別出品787件で判定を全部やり直して確認
- 03 / ニュース朝夕2便と速報候補258〜337件から19〜29件へ
- 04 / 音声入力使うほど育つ変換辞書137語から167語へ(2週間分)
研修・会議の録画を、文字起こしと場面の画像のノートにまとめる
研修・勉強会・ウェビナーの録画を見返して、メモを作る作業が消えます。動画を渡すと、全文の文字起こし、場面ごとの画像、画面に映った文字がそろったノートが保存され、チャットに完了の知らせが届きます。
- 受け取るチャットに動画のURLを貼る。新着を決まった時刻に取り込むこともできる
- 文字にする字幕が無ければ、音声からPCの中で文字起こし。長い動画は30分ごとに刻んで繋ぐ
- 場面を抜く場面が切り替わったコマを、動画の最初から最後まで散らして残す
- 画面の文字を読むコマに映った文字をOCRで読む。URLは別の一覧にして、目で確かめてから開く
- 届けるノートと一覧画像を保存し、チャットへ知らせる。動画そのものは消す
41秒
45分24秒の動画(字幕あり)を処理した時間。場面の画像40枚が0:00〜45:10に散らばり、40枚すべてに画面の文字が付いた
測定 2026-09-14
23秒
字幕が取れなかった5分37秒の動画を、音声からの文字起こし込みで処理した時間(自分のPCで)
測定 2026-09-14
162回
自分用の運用で成功した取り込み。失敗した30回も、理由つきで記録に残っている
記録 2026-08-05〜09-18
任せていただける理由
- AIを呼ばない作りなので、何本流しても利用料はかかりません
- 取れなかった時は「空でした」とすぐ知らせます。空のノートを黙って置きません
- DRMのかかった商用配信は、最初に機械で弾きます
- 同じ動画を2つのチャンネルに貼っても、取り込みは1回です
使った技術
- Python
- ffmpeg
- faster-whisper
- Windows 内蔵OCR(7言語)
- Discord Bot
- Markdown
- タスクスケジューラ
要約はしません(AIを呼ばない設計のため)。要約が要る時は、このノートを材料に人かAIが後から行います。扱うのは、利用が認められた動画に限ります。
中古品の新着通知から、本命だけを5件ずつチャットへ届ける
リユース・買取・中古販売のお店で、売買掲示板の新着通知を1通ずつ開き、「業者の広告か、本命か」「本当に0円か」を見分ける作業が消えます。届いた通知メールを機械が読み、本当に0円の品と高額の品を上に、業者の広告を後ろに並べて、1回5件だけ出します。
- 受け取る掲示板から届いた新着通知メールを、読み取り専用で開く。相手のサイトは巡回しない
- ふるい分ける「ジャンク」「取引中」「お譲り先決定」など、もう手に入らない物を外す
- 値段を読む題名から品物の値段を読む。「定価◯円」「送料無料」の数字は品物の値段に数えない
- 並べ替える0円の品と高額の語は上へ。通し番号つきの在庫など業者の広告は、消さずに後ろへ
- 届ける1日4回確かめて、1回5件・1日20件まで。同じ語は1時間おき、夜23時〜朝7時は鳴らさない
787件
実物の通知メール6通の出品を、全部判定し直して確かめた数。「0円」と判定した50件は、すべて本当に無料の品だった
測定 2026-09-18
16% → 0件
届いた通知に業者の広告が混ざった割合(直す前の5日間で80件中13件)。直した後の最初の1便は5件中0件
測定 2026-09-18
0件
787件で試した時に消えた出品。上位にいた業者の在庫21件は後ろへ回り、本命の品を下げた数も0件
測定 2026-09-18
任せていただける理由
- AIは使っていません。利用料はかかりません
- メールには既読も付けず、削除も移動もしません
- 掲示板以外の差出人のメールは、件名も本文も外に出しません
- 業者の広告は後ろへ回すだけで、消しません。本命を黙って捨てないためです
使った技術
- Python
- IMAP(読み取り専用)
- 正規表現
- 語はJSONで管理
- Discord
- タスクスケジューラ
- 自動テスト103本
いまは自分の品探し(ジモティーの新着通知)で動かしています。売れる値段(相場)との比較は、まだ付けていません。今の判定は、題名の語と値段だけです。
03 / 情報収集の自動化・ニュース
自分用に運用中
業界ニュースの朝の下調べを、朝夕2便と速報に
毎朝ニュースサイトや海外の技術サイトを順に回って、朝会や社内共有の話題を拾う作業が消えます。朝7時と夜7時に国内外の記事を集め、分野ごとに色分けしてチャットへ届けます。製品の回収のように手を止めて読む知らせは、15分おきの見張りが速報で出します。
- 集める海外の技術(Hacker News・GitHub・論文のarXiv)、国内ニュースのRSS 16本、検索の急上昇
- 既読を外す一度出した記事は覚えておき、二度出さない
- 点を付ける興味の語との重なり、情報源の重み、勢い(★の数・HNの点)。語に当たらなくても★2,000以上・HN 400点以上は拾う
- 分野に分ける業界・規制/国内/経済/技術などに分け、色の帯と見出しで境目を付ける
- 届ける朝7時・夜7時の便。速報は1回4本・1日12本まで、同じ語は3時間黙る。夜中の分は朝の便へ
19〜29件
1回に届けた本数。集めた候補258〜337件から絞った(直近12回の実行)
記録 2026-09-10〜09-18
2件 → 8件
興味の語だけで絞っていた頃、候補164件から残ったのは2件だった。勢いの基準を足して8件に(うち6件が世界で話題の物)
測定 2026-08-16
0円
15分おきに動かしてもかからない利用料(2026-09-15は96回実行)。AIを呼ばず、キーの要らない公開APIとRSSだけで動く
記録 2026-09-15
任せていただける理由
- 当たりが無い日は「無かった」とだけ言って黙ります
- 夜23時〜朝7時の速報は、捨てずに朝の便へ回します
- 語と数字だけで選ぶので、なぜその記事が出たかを必ず説明できます
- 書き込みの途中で止まっても、既読の記録を壊さない書き方にしてあります
使った技術
- Python
- Hacker News API
- GitHub API
- arXiv API
- RSS
- Googleトレンド
- Discord(分野ごとの色帯)
- 自動テスト39本
自分の情報収集のために、朝夕の便と速報を動かしています。記事の要約はしません(AIを呼ばないため)。X(旧Twitter)のように有料APIが要る所は拾っていません。
04 / 音声入力の精度・辞書の自動学習
自分用に運用中
専門用語の多い職場の音声入力に、使うほど育つ変換辞書
社名・製品名・専門用語を、音声入力が毎回同じように間違え、そのたびに手で直す作業が減ります。会話の記録から「誤変換 → 正しい表記」の候補を機械が拾い、確かめてから辞書へ入れます。
- 拾う音声入力が書いた語と、同じ会話の中で正しく綴られた語を、読みの近さで突き合わせる(AIの呼び出し0回)
- 絞る辞書の見出しと完全に一致する、普通の言葉は候補から外す
- 確かめる候補を1組ずつ、人かAIが ✓ か ✗ で判定する。人名・IDなど個人情報の候補は外す
- 関門を通す別の語を巻き込む組、数字が消える組、音声コマンドの言葉を落とす
- 入れる退避を取ってから辞書へ。台帳に残し、1コマンドで戻せる。✗の組は覚えて次から出さない
113組
自分の発話 約40万字から、機械だけで絞った候補の数(AIの呼び出し0回)
測定 2026-08-22
56%
機械だけで作った候補の的中率(96組すべてを判定)。だから自動では入れず、必ず確かめる
測定 2026-08-22
137→ 167語
2週間分の会話247本から候補58組、確かめて35組を採用した後の辞書の語数。個人情報の2件などは除外
記録 2026-09-13
任せていただける理由
- 音声認識そのものには手を入れません。直すのは、認識した後の置き換えだけです
- 「大好き」が「代行き」に化けるような、普通の日本語を書き換える組は入れません
- ✗にした組は覚えていて、次から出しません
- 入れる前に退避を取るので、1コマンドで元に戻せます
使った技術
- Python
- pykakasi(読み)
- JMdict・Wiktionary
- JSONの辞書と台帳
- 音声認識の後処理
自分で作って販売している音声入力ツール(Kotocast)の、自分の辞書を育てるのに使っている仕組みです。機械で拾えるのは誤変換の一部です(30語の標本から、拾えたのは約13%と推定)。残りは使いながら足していきます。