HuaRenCa
meisan

meisan

@meisan

Creator at MESHY

MESHYCreator
4 followers
4 following
6 posts
meisan@meisan · 2026-07-04

フロントエンドの友人が解雇され、社長が「AIで3人分をカバーできる」と言ったので、どの職種が危険か実際に検証してみた

先月、友人が解雇された。フロントエンド開発者で、能力は悪くなかった。彼が社長に尋ねた。「私の問題ですか?それとも会社の問題ですか?」社長は言った。「去年、一人でAIを使って3人分の仕事をこなせた。君の問題ではなく、君のポジションの問題だ。」

この出来事を受けて、私ははっきりさせようと決意した。一体どの職種で、このようなことが起きているのか?

誰もがAIがどれだけの仕事を代替するか語っている。シティは7000万の雇用がリスクにさらされると言い、マッキンゼーは30%の仕事が代替されると言う。数字は大きいが、自分に関係あると思うか?

私は自ら20の職種をテストし、各職種のコアタスクを分解し、AIができるか、どれだけうまくできるか、どこが不足しているかを項目ごとに検証した。4次元の評価フレームワークを設計し、各職種に代替指数を算出した。

この指数は特定の職種が必ず消えることを意味するわけではないが、風向きを示すことができる。参考になれば幸いだ。


4つの次元で職種の危険度を明確に

「AIはこの仕事ができるか?」という質問は漠然としすぎている。分割して考える必要がある。

次元1:タスクの標準化度(1-10点)

毎日行う仕事のうち、どれだけが決まった手順に従い、標準的な答えがあるか?

データ入力、請求書審査、カスタマーサービスの問い合わせ確認など、すべてのステップにSOPがある。AIはこれらを人間より速く、ミスなく行える。こうしたものは高得点。

心理カウンセリングやブランドポジショニングには標準的な答えがなく、判断は毎回異なる。これらは低得点。

次元2:判断の代替可能性(1-10点)

仕事の中で、決断を下す瞬間はどれだけあるか?それらの瞬間に明確な正誤はあるか?

得点が高いほど、判断にルールがあり、AIに取って代わられやすい。

カスタマーサービスがスクリプトに従って回答する場合、ルールは明確で判断の余地は小さい。高得点。

プロダクトマネージャーが要件の優先順位を決める場合、標準的な答えはなく、結果に責任を負う必要がある。低...

meisan@meisan · 2026-07-03

AIエージェントにネットワークへのフルアクセスを許可しました YOLO

ソファに座ってビールを飲みながら、クイックプロンプトと完全なレポートを楽しむのに勝るものはありません🥂。

ScreenShot_2026-07-03_111211_273.png

ScreenShot_2026-07-03_111111_903.png

meisan@meisan · 2026-07-01

AIの専門家は、なぜ、あるいは何がミソスクラスモデルを特別にしたのか説明できますか?

私の推測では、何らかの方法でトークナイザーを変更したのだと思います。しかし、仲間のAI愛好家からの見解も聞きたいです。

meisan@meisan · 2026-07-01

AIエージェントの新パラダイム:video-useがテキストで動画編集を実現する方法

browser-useチームが最近、video-useというプロジェクトをオープンソース化し、1日で約1000スターを獲得しました。

その内容はSFのように聞こえます。未編集の生素材をClaudeに渡すと、自動で口癖を削除し、カットポイントを調整し、字幕を追加し、色調補正を行い、最終的に完成した動画を出力します。

しかし、私が注目したのはその方法です。

AIが動画を編集することはもはや目新しいことではありません。重要なのはどのように編集するかです。

この動画編集AIは、最初から最後まで動画を見ていません。

フレームごとに画像を理解することもなく、動画をマルチモーダルモデルに与えることもなく、ほとんどの時間はわずか数十KBのテキストだけを扱っています。

これは手抜きではありません。

これは、現在最も賢いエージェント製品が共有する同じアプローチです。

これを理解することは、「また新しいAI編集ツールが出た」と知るよりもはるかに有益です。


仮に、10分の動画をモデルに理解させたいとします。

最も直感的な方法はフレーム抽出です。毎秒数フレームを抽出すると、全体で約3万フレームになります。各フレームをマルチモーダルモデルに渡すには約1500トークンが必要です。

掛け算すると、画像を一度見るだけで4500万トークンを消費します。

しかも、モデルが覚えるのはほとんどノイズです。1.2万フレーム目に誰かが話していることはわかっても、何を言っているか、どこをカットすべきかは、画像だけでは教えてくれません。

これは仮定の話ではありません。

今年5月の公開評価では、画面を見て操作するビジュアルエージェントが、同じタスクを完了するのに、直接APIを呼び出す場合の45倍のトークンを消費することがわかりました。

計算コストの問題だけでなく、さらに悪いことに、パフォーマンスも劣ります。スクリーンショットを見てボタンをクリックするエージェントは、しばしば位置を間違えたり、ポップアップに惑わされたりします。

**モデルに生データを...

meisan(MESHY):連絡先・最新情報 | Huarenca